阿里开源 Qwen3.8-Flash-Next:架构重构,成本降九成
AI寒武纪 · wechat · 2026-08-26
阿里发布了 Qwen4 架构的早期预览版 Qwen3.8-Flash-Next,并开源了权重。该模型为主干 125B 的多模态 MoE 模型,引入 51B 的 N-gram 嵌入参数,训练成本仅为 Qwen3.7-Plus 的约九分之一,但在代码和办公任务上实现超越。
核心架构升级
- 混合注意力机制 (GDN + QSA):
- 四层中三层使用门控 Delta 网络 (GDN) 压缩历史信息,一层使用通义稀疏注意力 (QSA) 进行全局检索。
- QSA 通过块级别索引筛选重点,在 100万 Token 长度下,Prefill 和 Decode 阶段分别加速 7.6 倍和 4.9 倍。
- 四分支门控残差:
- 将单通道残差流拓宽为四个并行分支,引入动态门控机制。
- 有效抑制激活异常值,支持 FP8 存储以降低显存开销。
- N-gram 外挂嵌入:
- 引入 51B 参数的 N-gram 嵌入层,利用局部上下文查表。
- 参数存放在主机内存,通过异步预取与 GPU 计算重叠,不占用显存且几乎不增加计算量。
- Muon 优化器定制:
- 针对不同层参数分工使用 Muon 和 AdamW,拆分融合矩阵以执行正交化。
- 支持更大学习率和批大小,去除了 Batch Size Warmup 步骤,节省 18.8% 优化步数。
性能与定价
- 官方跑分显示在代码编写等任务上超越 DeepSeek V4 flash (0731) 和 Opus 4.6 Max。
- 商用版定价为每百万输入 Token 1 元、输出 3 元。
- 原生支持 262K Token 上下文,通过 YaRN 技术可扩展至 1M Token。
(注:文中前半部分提到的智谱 GLM-5.3-Flash 为自媒体臆造内容,未在官方渠道证实,故不予采纳。)
所属事件:阿里发布 Qwen3.8-Flash 多模态 MoE 模型,性价比引热议(26 条相关)→
「模型」频道最新
- Gemini 异常泄露内部思维:回复出现 "sff" — Regular_Preference64 · 2026-08-28
- GLM-5.2 引入监控机制,有效对抗 RL 奖励黑客攻击 — burny_tech · 2026-08-28
- 实测 Anthropic Luna Max:额度宽松速度极快 — timpera · 2026-08-28
- 用户吐槽 Grokbot 表现糟糕,任务遗漏严重 — krishnan · 2026-08-28
- Prime Intellect 发布 18 个前沿模型的自主 AI 研究能力评估报告 — mariofilhoml · 2026-08-28
- 模型优化不应只追求思考时的 token 数量 — abacaj · 2026-08-28