阿里 Qwen3.8 搭配 51B N-gram 嵌入,现已支持 SGLang 部署

Alibaba_Qwen · x · 2026-08-26

阿里巴巴宣布 Qwen3.8-Flash-Next 模型已支持通过 SGLang 进行 Day-0 部署。该模型包含 125B 主参数与 51B N-gram 嵌入,每 token 仅激活 6B 参数。其架构特点包括:

模型训练采用了 Muon 优化器。

所属事件:阿里开源Qwen3.8-Flash-Next:125B稀疏MoE预览Qwen4架构(11 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →