Qwen3.8-Flash-Next 架构解构:125B 参数与稀疏 MoE

Alibaba_Qwen · x · 2026-08-26

vLLM 宣布支持 Qwen3.8-Flash-Next,这是一款超稀疏 MoE 多模态模型。该模型拥有 125B 总参数,包含 51B N-gram 查找表,每 Token 仅激活 6B 参数,原生支持 26.2K 上下文(可通过 YaRN 扩展至 1M)。架构结合了 Gated DeltaNet(压缩历史)、Qwen Sparse Attention(长程检索)和 MTP(推测解码)。N-gram 表可卸载至主机内存以节省显存。

所属事件:阿里开源多模态MoE模型Qwen3.8-Flash-Next(10 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →