阿里千问发布 Qwen3.8-Flash:每Token激活6B,成本降9倍
千问大模型 · wechat · 2026-08-26
阿里千问发布 Qwen3.8-Flash 多模态 MoE 模型,主模型 125B,每 token 仅激活 6B 参数。模型采用 GDN+QSA 混合架构、GatedResidual 多分支残差及 N-gram Embedding 扩展容量,支持原生 26.2 万上下文(可扩展至 1M)。相比 Qwen3.7-Plus,训练成本仅约 1/9,但编码与办公能力更强。API 定价为输入 1 元/百万 tokens,输出 3 元/百万 tokens。同时开源了基于新架构的 Qwen3.8-Flash-Next 权重。
所属事件:阿里开源Qwen3.8-Flash-Next:125B稀疏MoE预览Qwen4架构(11 条相关)→
「模型」频道最新
- GLM-5.3-Flash 采用稀疏+线性注意力混合架构 — multimodalart · 2026-08-26
- GLM-5.3-Flash 采用混合注意力降成本 — multimodalart · 2026-08-26
- 智谱 GLM-5.3-Flash 发布:性能超 Opus 4.8,体积更小 — airesearch12 · 2026-08-26
- 智谱疑似悄然发布 glm-5.3-flash 模型 — koltregaskes · 2026-08-26
- mLateOn 表现惊艳,实测击败大型 Qwen 模型 — antoine_chaffin · 2026-08-26
- Zai 推出 320B 参数 GLM-5.3-Flash 模型 — TheZachMueller · 2026-08-26