阿里 Qwen3.8 搭配 51B N-gram 嵌入,现已支持 SGLang 部署
Alibaba_Qwen · x · 2026-08-26
阿里巴巴宣布 Qwen3.8-Flash-Next 模型已支持通过 SGLang 进行 Day-0 部署。该模型包含 125B 主参数与 51B N-gram 嵌入,每 token 仅激活 6B 参数。其架构特点包括:
- N-gram 嵌入:在不显著增加每 token 计算量的前提下扩展模型容量,且可存储于主机内存,通过异步预取不占用 GPU 显存。
- GDN + QSA 混合注意力:在长周期任务中兼顾内存效率与精准检索。
- Gated Residual:将层间信息通道从 1 条扩展至 4 条。
模型训练采用了 Muon 优化器。
所属事件:阿里开源Qwen3.8-Flash-Next:125B稀疏MoE预览Qwen4架构(11 条相关)→
「Infra」频道最新
- Knowledge Compressor:压缩文档减半 Agent Token 成本 — mariorod1 · 2026-08-26
- SIMD 指令修复 UTF-16 字符串,提速 9 倍 — lemire · 2026-08-26
- 阿里:AI 资本开支三年回本,2020 年的 A100 至今满负荷 — Beth_Kindig · 2026-08-26
- CSIS:美光本土内存产能不足自身供应的 2%,AI 硬件短板凸显 — PeterDiamandis · 2026-08-26
- Qwen3.8-Flash-Next 免费端点上线:H200 跑出 100 tok/s — victormustar · 2026-08-26
- Signadot 实现 PR 级预览环境秒级启动 — pjausovec · 2026-08-26