阿里开源Qwen3.8-Flash-Next:6B激活参数的超稀疏MoE预览Qwen4架构
8月26日,阿里通义千问团队在Hugging Face与ModelScope发布并开源多模态MoE模型Qwen3.8-Flash-Next,定位为Qwen4架构的早期预览,并同步发布技术报告与详细性能评测。模型主参数125B、外加约51B N-gram嵌入参数,每token仅激活6B参数,官方与媒体称训练成本降至前代约1/9;vLLM、SGLang与NVIDIA NeMo均已实现Day-0支持。社区转述其基准表现以约一半参数量击败DeepSeek V4 Flash并超越Claude Opus 4.6,编码榜单上拿下ClawEval与多语言SWE-Bench第一,是当日最受关注的开源模型事件,8月27日起量子位、智东西等媒体跟进报道进一步扩散。
已确认
- 官方(@AlibabaQwen、@Qwen)确认模型为多模态MoE架构,主模型总参数125B,每token仅激活6B参数,主打极致性价比(@智东西称价格腰斩、训练成本降至前代1/9)。
- 架构升级包括GDN+QSA混合注意力、GatedResidual多分支残差、N-gram Embedding扩展容量(额外约51B N-gram嵌入参数);@智东西提到引入Qwen Sparse Attention;@量子位称51B的N-gram Embedding受DeepSeek Engram启发;社区技术帖(@ying11231转述)给出更多细节:36层Gated DeltaNet加12层Qwen Sparse Attention的组合,并称显存占用降低23.5GB。
- 模型支持image-text-to-text图文多模态输入,兼容safetensors格式与API,Hugging Face上提供FP8版本开源;@量子位确认全部权重已开放。
- 上下文与定价:@AlibabaQwen宣布Qwen3.8-Flash已在QwenCloud上线,原生支持26.2万token上下文并可扩展至100万token。国内API定价方面,@AlchainHust称每百万token输入0.8元、输出2.7元、缓存命中0.1元,全程一口价无峰谷阶梯,并称缓存命中价为全球最低;@MaziyarPanahi补充海外口径为输入每百万token 0.15美元、输出0.47美元、缓存命中仅0.016美元,适合处理长文档和代码库。
- 推理与微调生态实现Day-0支持:vLLM宣布支持该模型(@AlibabaQwen转述);阿里官方确认可通过SGLang进行Day-0部署;NVIDIA(@NVIDIAAI)宣布首发日支持,开发者可使用NeMo AutoModel和NeMo RL进行领域特定微调,并通过SGLang、vLLM等部署。
- @jiqizhixin确认模型已在Hugging Face与ModelScope上线,并发布了技术报告与详细性能评测。
- 评测方面:@qinzytech转述称该模型在Agents' Last Exam评测中得分51.2、Pass@1达24.3%;@elemental-mind称其参数量约为DeepSeek V4 Flash的一半但性能更强,并超越Opus 4.6;@SimplyAnnisa称9项对比基准中胜出8项;@kimmonismus转述其击败Claude Opus;@jyangballin转述的编码基准成绩显示其在ClawEval和多语言SWE-Bench上排名第一、DeepSWE排名第二、SWE-Bench Pro位列第三。8月28日@bindureddy进一步称其性能超越GLM 5.3 Flash和DeepSeek Flash、开放权重且定价极具竞争力,并认为这是"智能廉价化"趋势的体现;其引用的输入价为0.16美元,与@MaziyarPanahi的0.15美元口径略有出入。
- @sammcj开设集中讨论区,主题涵盖量化版本、微调与反微调、聊天模板、推理服务器支持配置及模型对比。
尚未确认
- @ariG23498称模型参数量为180B,与官方125B总参数+51B N-gram嵌入口径不一致,可能是两者合计的另一种统计方式,以官方口径为准。
- "6B激活参数击败Claude Opus/DeepSeek V4 Flash/GLM 5.3 Flash"等结论及各项榜单排名均来自社区转述,具体测试条件需以官方技术报告与完整榜单为准;36层/12层结构与23.5GB显存节省等架构细节亦来自社区转述帖,未经官方技术报告逐条核对。@AlchainHust关于"缓存命中价全球最低"、@bindureddy关于"目前市场上最好的Flash模型"的对比表述也属作者个人评价。
为什么重要
- 作为Qwen4架构的首次预览,其极稀疏MoE设计(6B/125B激活比)与GDN+QSA、GatedResidual、N-gram Embedding等新架构代表了阿里下一代模型的技术方向;其中N-gram Embedding对DeepSeek Engram思路的借鉴也反映出开源社区架构创新的接力。
- 极低激活参数带来大幅成本下降(国内每百万token输出2.7元一口价、缓存命中0.1元,海外输入0.15美元、缓存命中低至0.016美元、可扩展至100万上下文),若基准表现(含编码与Agent评测榜单)得到验证,将对闭源高端模型(如Claude Opus)及同级Flash模型的性价比构成直接挑战;全部权重开放及vLLM、SGLang、NVIDIA NeMo的快速支持也显著降低了部署与微调门槛。
2026-08-26 ~ 2026-08-28 · 25 条相关
- 第 1 集:阿里官宣 Qwen3.8-Flash-Next 开源,预览 Qwen4 架构(2026-08-25,13 条)
- 第 2 集:阿里开源Qwen3.8-Flash-Next:6B激活参数的超稀疏MoE预览Qwen4架构(2026-08-26,25 条)
- 第 3 集:Qwen3.8 Flash 登顶 SWE-bench Pro,成本仅竞品九分之一(2026-08-26,2 条)
- 第 4 集:Qwen3.8-Flash 支持 75GB 内存本地运行并推量化版(2026-08-26,2 条)
- 第 5 集:Qwen3.8-Flash-Next FP8 量化模型在 Hugging Face 发布(2026-08-27,2 条)
- 第 6 集:Qwen 3.8-Next 发布,技术报告详解架构与预训练(2026-08-27,2 条)
一手来源
- 阿里发布 Qwen3.8-Flash 预览版,架构升级成本大降 — Alibaba_Qwen ·
- 阿里 Qwen 发布多模态模型 Qwen3.8-Flash-Next — Qwen ·
- Qwen3.8-Flash 上线:百万上下文,输入每百万仅需 0.15 美元 — Alibaba_Qwen ·
- Qwen 3.8 Flash Next 模型发布日,量化和微调讨论开启 — sammcj · 2026-08-26
- 【源头】阿里发布 Qwen3.8-Flash 预览版,架构升级成本大降 — Alibaba_Qwen · 2026-08-26
- 阿里千问发布 Qwen3.8-Flash:每Token激活6B,成本降9倍 — 千问大模型 · 2026-08-26
- Qwen 3.8 Flash-Next 发布:6B 激活参数击败 Claude Opus — kimmonismus · 2026-08-26
- 阿里通义 Qwen3.8-Flash-Next 模型发布 — ariG23498 · 2026-08-26
- 【源头】阿里 Qwen 发布多模态模型 Qwen3.8-Flash-Next — Qwen · 2026-08-26
- Qwen3.8-Flash-Next 架构解构:125B 参数与稀疏 MoE — Alibaba_Qwen · 2026-08-26
- 阿里发布 Qwen3.8-Flash:性价比惊人,规格暗示 Qwen4 架构 — jiqizhixin · 2026-08-26
- Qwen 3.8 Flash Next 发布:半参击败 DS V4 — elemental-mind · 2026-08-26
- 阿里 Qwen3.8 搭配 51B N-gram 嵌入,现已支持 SGLang 部署 — Alibaba_Qwen · 2026-08-26
- 阿里开源 Qwen3.8-Flash-Next:架构重构,成本降九成 — AI寒武纪 · 2026-08-26
- 阿里Qwen3.8-Flash-Next发布:每Token仅激活6B参数,价格腰斩 — 智东西 · 2026-08-27
- Qwen3.8-Flash-Next发布,主打极致成本效益 — petrusenko_max · 2026-08-27
- Qwen3.8-Flash-Next 技术解构:GDN+QSA 混合注意力,显存占用降低 23.5GB — ying11231 · 2026-08-27
- Qwen3.8-Flash-Next 评测创新高,小参数模型表现强 — qinzytech · 2026-08-27
- 阿里开源 Qwen3.8-Flash-Next:架构借鉴 DeepSeek — 量子位 · 2026-08-27
- NVIDIA 首发 Qwen3.8-Flash-Next,NeMo 支持微调 — Alibaba_Qwen · 2026-08-27
- NVIDIA NeMo 宣布首发支持通义 Qwen 微调 — NVIDIAAI · 2026-08-27
- Qwen3.8-Flash-Next 发布,登顶 ClawEval 与多语言 SWE-Bench — jyangballin · 2026-08-27
- 【源头】Qwen3.8-Flash 上线:百万上下文,输入每百万仅需 0.15 美元 — Alibaba_Qwen · 2026-08-27
- Qwen3.8-Flash 缓存命中仅 $0.016/百万 tokens — MaziyarPanahi · 2026-08-27
- Qwen3.8-Flash杀价:输出2.7元一口价,缓存命中全球最低 — AlchainHust · 2026-08-27
- 通义 Qwen Flash 性能超越 DeepSeek 与 GLM 5.3 — bindureddy · 2026-08-28
另有 2 条近重复转述:SimplyAnnisa · bindureddy