SGLang 发布 Qwen3.8-Flash-Next 母日部署食谱:176B 参数仅 6B 激活
NVIDIAAI · x · 2026-09-08
阿里 Qwen 团队发布 Qwen3.8-Flash(官方称 Qwen4 架构预览),SGLang 作为母日合作伙伴同步上线部署食谱(cookbook),每套方案均已在硬件上实测验证:
- 模型架构:176B 参数(文档口径),其中 51B 为 N-gram embedding 用于扩展模型容量,每 token 仅 6B 激活;N-gram 表可放在主机内存中异步预取,不占 GPU 显存
- 注意力设计:GDN + QSA 混合注意力兼顾长程任务的显存效率与精确检索;Gated Residual 提供 4 条层间信息通道
- 部署配方:单卡 RTX PRO 6000(PLE 表放系统内存)、单台 DGX Spark(本地 NVMe)、双 DGX Spark TP=2,并支持 RadixArk 与 NVIDIA ModelOpt 导出的 NVFP4 量化
- 注意事项:模型支持尚未进正式版,需按 PR #36497 从源码构建安装;团队称已根据社区反馈修复多个新架构相关问题
Muon 优化器训练、更多性能优化仍在路上。
「Infra」频道最新
- M.2-Oculink 显卡链路暗降 PCIe 1x,附 lspci 排查命令 — El_90 · 2026-09-11
- DeepSeek 发布 V4.1-Flash:百万 token 上下文,KV 缓存缩小 4 倍 — matlabulous · 2026-09-11
- 8GB 显存还能干嘛?网友求解小模型现状与推荐 — riceinmybelly · 2026-09-11
- 西班牙新规要求 80% 逐小时绿电匹配,数据中心建设或耗资千亿欧元 — eherrerosj · 2026-09-11
- Draghi 引用 ECB 研究:AI 或每年提振欧洲生产率 0.3-0.4 个百分点 — rohanpaul_ai · 2026-09-11
- 高通新一代 Hexagon NPU 曝光:可跑 30B MoE,上下文 32K — lee_stott · 2026-09-11