专题 · FULL STORY
Qwen3.8-Flash-Next 开源:Qwen4 架构预览亮相
8 月 25 日阿里官宣下一代 Qwen4 架构已就绪,次日即在 Hugging Face 与 ModelScope 开源 125B 稀疏多模态 MoE 模型 Qwen3.8-Flash-Next,作为 Qwen4 架构的预览版,从官宣到开源仅隔一天,社区迅速跟进热议。
2026-08-25 ~ 2026-08-26 · 2 集 · 24 条
第 1 集 · 阿里官宣 Qwen3.8-Flash-Next,Qwen4 架构预览 8 月 26 日开源(2026-08-25,13 条)
8 月 25 日,阿里通义千问团队通过 ModelScope 官方渠道宣布下一代架构 Qwen4 已就绪,并在 Hugging Face 上线 Qwen/Qwen3.8-Flash-Next 发布预告页,确认该模型于 8 月 26 日正式开源。页面将其定位为「Qwen4 架构的预览」,引发社区高度关注,等待发布通知的人数从发布前的 45 人(@NielsRogge 8 月 25 日观察)增长到 8 月 26 日的 515 人(@victormustar 观察)。
已确认
- 官方宣布 Qwen3.8-Flash-Next 于 8 月 26 日开源发布,预告页标注时间为 2026 年 8 月 26 日
- 模型为开放权重的多模态混合专家(MoE)设计
- 总参数量 1250 亿,其中包含 510 亿 N-gram 参数,每个 Token 仅激活 60 亿参数
- 模型基于将支撑即将到来的 Qwen4 系列的下一代架构构建
- 8 月 26 日 @alexcovoeth 转述称 Qwen3.8-120B/51B/A6B MoE 系列将在 24 小时内发布
- @TheZachMueller 转述称 Qwen3.8 Flash 针对单台 DGX Spark 优化,可用 NVFP4 精度运行
尚未确认
- @alexcovoeth 转述的「Qwen3.8-120B/51B/A6B 系列 24 小时内发布」是否意味着同系列其他模型一并发布,尚无官方确认
- 510 亿 N-gram 查表参数的具体作用,@teortaxesTex 帖中评论者 superelesha 的分析仍有待发布后实测验证
- @TheZachMueller 提到的 DGX Spark 部署信息来自第三方转述,具体支持精度与配置待官方证实
为什么重要
- 按 @calabiandyau 的说法,此举相当于让开发者提前试用 Qwen4 家族的架构改进,是 Qwen 系列的又一次重大更新
- @rohanpaulai 指出,大总参数量配合低激活参数量的设计旨在实现高性能推理效率,若表现达标,可能成为高性价比开源模型的新选项
- 510 亿 N-gram 查表/嵌入参数是此前主流开源模型中少见的配置,@zephyrz9 等社区成员关注这一架构细节
- 若单台 DGX Spark 即可运行的传闻属实,将进一步降低本地部署门槛
- 阿里预告 Qwen3.8-Flash-Next 架构升级,下代模型将开源 — bclavie · 2026-08-25
- Qwen 3.8 Flash Next 将发布:125B 参数含 51B N-gram — zephyr_z9 · 2026-08-25
- Qwen 官宣:Qwen3.8-Flash-Next 即将开源 — cedric_chee · 2026-08-25
- 阿里 Qwen3.8-Flash-Next 明日发布,采用 Qwen4 架构 MoE — rohanpaul_ai · 2026-08-25
- Qwen4 首秀前奏:阿里将开源多模态 MoE 模型 Qwen3.8-Flash-Next — calabi_and_yau · 2026-08-25
- 阿里通义 Qwen4 架构预览,8 月 26 日正式发布 — NielsRogge · 2026-08-25
- 曝 Qwen 3.8 Flash Next 明日发布:125B+51B N-gram 查表 — teortaxesTex · 2026-08-25
- Qwen3.8-Flash-Next 定档 8 月 26 日,Qwen4 架构预览来袭 — huggingface · 2026-08-25
- 通义Qwen4架构预览版Qwen3.8-Flash-Next即将发布 — huggingface · 2026-08-26
- Qwen3.8系列MoE模型24小时内发布 — alexcovo_eth · 2026-08-26
- Qwen3.8-Flash-Next 上线倒计时,预告 Qwen4 架构预览 — victormustar · 2026-08-26
- Qwen3.8-Flash-Next 模型即将发布 — jiqizhixin · 2026-08-26
- GLM 5.3 与 Qwen3.8 Flash 即将发布,支持 DGX Spark 部署 — TheZachMueller · 2026-08-26
第 2 集 · 阿里开源Qwen3.8-Flash-Next:125B稀疏MoE预览Qwen4架构(2026-08-26,11 条)
8月26日,阿里通义千问团队在Hugging Face与ModelScope发布并开源多模态MoE模型Qwen3.8-Flash-Next,定位为Qwen4架构的早期预览,并同步发布技术报告与性能评测。模型主参数125B、每token仅激活6B,官方称成本降9倍,vLLM与SGLang均已宣布Day-0支持。社区转述其基准表现超过Claude Opus 4.6与DeepSeek V4 Flash,是当日最受关注的开源模型事件之一。
已确认
- 官方(@AlibabaQwen、@千问大模型)确认模型为多模态MoE架构,主模型总参数125B,每token仅激活6B参数,主打极致性价比(@千问大模型称成本降9倍)。
- 架构升级包括GDN+QSA混合注意力、GatedResidual多分支残差、N-gram Embedding扩展容量(额外约51B n-gram嵌入参数)。
- 模型支持image-text-to-text图文多模态输入,兼容safetensors格式与API,Hugging Face上提供FP8版本开源;原生支持26.2K上下文(可通过YaRN扩展)。
- vLLM宣布支持该模型(@AlibabaQwen转述);阿里官方另确认模型已可通过SGLang进行Day-0部署。
- @jiqizhixin确认模型已在Hugging Face与ModelScope上线,并发布了技术报告与详细性能评测。
- @elemental-mind称该模型参数量约为DeepSeek V4 Flash的一半,但性能更强,并超越Opus 4.6;@SimplyAnnisa称9项对比基准中胜出8项;@kimmonismus转述其击败Claude Opus。
- @sammcj开设集中讨论区,主题涵盖量化版本、微调与反微调、聊天模板、推理服务器支持配置及模型对比。
尚未确认
- @ariG23498称模型参数量为180B,与官方125B总参数+51B n-gram嵌入口径不一致,可能是两者合计的另一种统计方式,具体以官方口径为准。
- "6B激活参数击败Claude Opus/DeepSeek V4 Flash"等结论来自社区转述,具体测试条件需以官方技术报告与完整榜单为准。
为什么重要
- 作为Qwen4架构的首次预览,其极稀疏MoE设计(6B/125B激活比)与GDN+QSA、GatedResidual、N-gram Embedding等新架构代表了阿里下一代模型的技术方向。
- 极低激活参数带来大幅推理成本下降,若基准表现得到验证,将对闭源高端模型(如Claude Opus)的性价比构成直接挑战;vLLM与SGLang的快速支持也降低了部署门槛。
- Qwen 3.8 Flash Next 模型发布日,量化和微调讨论开启 — sammcj · 2026-08-26
- 阿里发布 Qwen3.8-Flash 预览版,架构升级成本大降 — Alibaba_Qwen · 2026-08-26
- 阿里千问发布 Qwen3.8-Flash:每Token激活6B,成本降9倍 — 千问大模型 · 2026-08-26
- Qwen 3.8 Flash-Next 发布:6B 激活参数击败 Claude Opus — kimmonismus · 2026-08-26
- 阿里通义 Qwen3.8-Flash-Next 模型发布 — ariG23498 · 2026-08-26
- Qwen 3.8 Flash-Next 发布:6B 稀疏 MoE 超越 Claude Opus — SimplyAnnisa · 2026-08-26
- 阿里 Qwen 发布多模态模型 Qwen3.8-Flash-Next — Qwen · 2026-08-26
- Qwen3.8-Flash-Next 架构解构:125B 参数与稀疏 MoE — Alibaba_Qwen · 2026-08-26
- 阿里发布 Qwen3.8-Flash:性价比惊人,规格暗示 Qwen4 架构 — jiqizhixin · 2026-08-26
- Qwen 3.8 Flash Next 发布:半参击败 DS V4 — elemental-mind · 2026-08-26
- 阿里 Qwen3.8 搭配 51B N-gram 嵌入,现已支持 SGLang 部署 — Alibaba_Qwen · 2026-08-26