阿里开源 Qwen3.8-Flash-Next:架构借鉴 DeepSeek

量子位 · wechat · 2026-08-27

阿里发布 Qwen3.8-Flash-Next 全部权重,作为 Qwen4 新架构的预览版。模型采用 125B MoE 架构,核心创新在于引入了 51B 参数的 N-gram Embedding(受 DeepSeek Engram 启发)。该设计在不显著增加计算成本的前提下提升性能,训练时间降至原九分之一。架构同时升级了 QSA 稀疏注意力、Gated Residual 和 Muon 优化器。模型支持 100 万 token 上下文,API 价格约为 Max 版本的 1/12,并兼容 OpenAI/Anthropic 协议。

所属事件:阿里开源Qwen3.8-Flash-Next:Qwen4架构预览,每token仅激活6B(17 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →