Qwen3.8-Flash-Next 架构解构:125B 参数与稀疏 MoE
Alibaba_Qwen · x · 2026-08-26
vLLM 宣布支持 Qwen3.8-Flash-Next,这是一款超稀疏 MoE 多模态模型。该模型拥有 125B 总参数,包含 51B N-gram 查找表,每 Token 仅激活 6B 参数,原生支持 26.2K 上下文(可通过 YaRN 扩展至 1M)。架构结合了 Gated DeltaNet(压缩历史)、Qwen Sparse Attention(长程检索)和 MTP(推测解码)。N-gram 表可卸载至主机内存以节省显存。
所属事件:阿里开源多模态MoE模型Qwen3.8-Flash-Next(10 条相关)→
「Infra」频道最新
- 阿里 Qwen3.8 搭配 51B N-gram 嵌入,现已支持 SGLang 部署 — Alibaba_Qwen · 2026-08-26
- 边缘节点难脱离超中心化基础模型 — curious_vii · 2026-08-26
- 预告:Apple MLX 本地模型运行新进展 — dscape · 2026-08-26
- Glean 实战:小模型组合拳节省 81% Token 成本 — _akhaliq · 2026-08-26
- Mac 跑 MiniMax H3 出 480p 视频 8 分钟:Turbo LoRA 提速工作流 — xNightWardenx · 2026-08-26
- 英伟达 Nemotron 助力受监管行业构建专用 263B 模型 — NVIDIA Developer · 2026-08-26