专题 · FULL STORY

Qwen3.8-Flash-Next 开源:Qwen4 架构预览亮相

8 月 25 日阿里官宣下一代 Qwen4 架构已就绪,次日即在 Hugging Face 与 ModelScope 开源 125B 稀疏多模态 MoE 模型 Qwen3.8-Flash-Next,作为 Qwen4 架构的预览版,从官宣到开源仅隔一天,社区迅速跟进热议。

2026-08-25 ~ 2026-08-26 · 2 集 · 24 条

第 1 集 · 阿里官宣 Qwen3.8-Flash-Next,Qwen4 架构预览 8 月 26 日开源(2026-08-25,13 条)

8 月 25 日,阿里通义千问团队通过 ModelScope 官方渠道宣布下一代架构 Qwen4 已就绪,并在 Hugging Face 上线 Qwen/Qwen3.8-Flash-Next 发布预告页,确认该模型于 8 月 26 日正式开源。页面将其定位为「Qwen4 架构的预览」,引发社区高度关注,等待发布通知的人数从发布前的 45 人(@NielsRogge 8 月 25 日观察)增长到 8 月 26 日的 515 人(@victormustar 观察)。

已确认

  • 官方宣布 Qwen3.8-Flash-Next 于 8 月 26 日开源发布,预告页标注时间为 2026 年 8 月 26 日
  • 模型为开放权重的多模态混合专家(MoE)设计
  • 总参数量 1250 亿,其中包含 510 亿 N-gram 参数,每个 Token 仅激活 60 亿参数
  • 模型基于将支撑即将到来的 Qwen4 系列的下一代架构构建
  • 8 月 26 日 @alexcovoeth 转述称 Qwen3.8-120B/51B/A6B MoE 系列将在 24 小时内发布
  • @TheZachMueller 转述称 Qwen3.8 Flash 针对单台 DGX Spark 优化,可用 NVFP4 精度运行

尚未确认

  • @alexcovoeth 转述的「Qwen3.8-120B/51B/A6B 系列 24 小时内发布」是否意味着同系列其他模型一并发布,尚无官方确认
  • 510 亿 N-gram 查表参数的具体作用,@teortaxesTex 帖中评论者 superelesha 的分析仍有待发布后实测验证
  • @TheZachMueller 提到的 DGX Spark 部署信息来自第三方转述,具体支持精度与配置待官方证实

为什么重要

  • 按 @calabiandyau 的说法,此举相当于让开发者提前试用 Qwen4 家族的架构改进,是 Qwen 系列的又一次重大更新
  • @rohanpaulai 指出,大总参数量配合低激活参数量的设计旨在实现高性能推理效率,若表现达标,可能成为高性价比开源模型的新选项
  • 510 亿 N-gram 查表/嵌入参数是此前主流开源模型中少见的配置,@zephyrz9 等社区成员关注这一架构细节
  • 若单台 DGX Spark 即可运行的传闻属实,将进一步降低本地部署门槛

第 2 集 · 阿里开源Qwen3.8-Flash-Next:125B稀疏MoE预览Qwen4架构(2026-08-26,11 条)

8月26日,阿里通义千问团队在Hugging Face与ModelScope发布并开源多模态MoE模型Qwen3.8-Flash-Next,定位为Qwen4架构的早期预览,并同步发布技术报告与性能评测。模型主参数125B、每token仅激活6B,官方称成本降9倍,vLLM与SGLang均已宣布Day-0支持。社区转述其基准表现超过Claude Opus 4.6与DeepSeek V4 Flash,是当日最受关注的开源模型事件之一。

已确认

  • 官方(@AlibabaQwen、@千问大模型)确认模型为多模态MoE架构,主模型总参数125B,每token仅激活6B参数,主打极致性价比(@千问大模型称成本降9倍)。
  • 架构升级包括GDN+QSA混合注意力、GatedResidual多分支残差、N-gram Embedding扩展容量(额外约51B n-gram嵌入参数)。
  • 模型支持image-text-to-text图文多模态输入,兼容safetensors格式与API,Hugging Face上提供FP8版本开源;原生支持26.2K上下文(可通过YaRN扩展)。
  • vLLM宣布支持该模型(@AlibabaQwen转述);阿里官方另确认模型已可通过SGLang进行Day-0部署。
  • @jiqizhixin确认模型已在Hugging Face与ModelScope上线,并发布了技术报告与详细性能评测。
  • @elemental-mind称该模型参数量约为DeepSeek V4 Flash的一半,但性能更强,并超越Opus 4.6;@SimplyAnnisa称9项对比基准中胜出8项;@kimmonismus转述其击败Claude Opus。
  • @sammcj开设集中讨论区,主题涵盖量化版本、微调与反微调、聊天模板、推理服务器支持配置及模型对比。

尚未确认

  • @ariG23498称模型参数量为180B,与官方125B总参数+51B n-gram嵌入口径不一致,可能是两者合计的另一种统计方式,具体以官方口径为准。
  • "6B激活参数击败Claude Opus/DeepSeek V4 Flash"等结论来自社区转述,具体测试条件需以官方技术报告与完整榜单为准。

为什么重要

  • 作为Qwen4架构的首次预览,其极稀疏MoE设计(6B/125B激活比)与GDN+QSA、GatedResidual、N-gram Embedding等新架构代表了阿里下一代模型的技术方向。
  • 极低激活参数带来大幅推理成本下降,若基准表现得到验证,将对闭源高端模型(如Claude Opus)的性价比构成直接挑战;vLLM与SGLang的快速支持也降低了部署门槛。