Qwen3.8-2.4T-A95B 开放权重上架 AWS,8×B300 单节点可跑
AWS ML Blog · rss · 2026-09-10
阿里 Qwen 团队于 2026 年 8 月 12 日发布 Qwen3.8-2.4T-A95B——首个开放权重的 Qwen-Max 级模型。AWS ML Blog 给出在 Amazon SageMaker HyperPod 上用 vLLM 部署的完整教程。
模型架构要点
- 总参数 2.4T,每 token 仅激活约 95B;细粒度 MoE:512 个路由专家 + 1 个共享专家,每 token 激活 10 个路由专家
- 92 层混合注意力:69 层 Gated DeltaNet(线性注意力,固定大小状态取代增长的 KV-cache)+ 23 层完整注意力,3:1 配比使计算与显存随上下文近似有界
- 原生上下文 262K,可扩展至约 1M;最大输出 128K;原生 MTP 草稿头支持投机解码,无需单独草稿模型
- 内置 reasoningeffort 参数(low/medium/high)按请求调节推理深度
部署方案
- 实例为 ml.p6-b300.48xlarge:8× NVIDIA B300 Blackwell Ultra,共 2.1TB HBM3e 显存,FP4 算力合计约 120 PFLOPS
- BF16 权重约 4.8TB,超出单节点;NVFP4(W4A4)量化后约 1.2TB,可单节点装载并留出 KV-cache 空间
- 教程覆盖集群开通到 OpenAI 兼容端点全流程:vLLM 配置、量化、内置推理控制、工具调用与 MTP 投机解码;HyperPod 提供自动权重下载、健康检查、KEDA 自动扩缩容与节点自愈
厂商基准显示其在 PaperBench(93.0)、IFBench(82.8)和终端编码(86.6)上表现突出,与前沿闭源模型相当,仓库级任务(SWE-bench Pro)仍有差距,适合自托管编码 agent 与研究流水线。
「Infra」频道最新
- NVIDIA LPU 团队招 Rust 工程师,公司已加入 Rust 基金会 — ricklamers · 2026-09-10
- 美国40年来首座稀土磁铁厂动工,年产7000吨瞄准机器人执行器供应链 — MatthewChang · 2026-09-10
- LithosAI 公开 API 上线,主打 Kimi K3 最快最低价推理 — sh_reya · 2026-09-10
- Marvell CEO 在 Citi 会议看好前景,市场机会或超预期 — BenBajarin · 2026-09-10
- MLX 框架也能在 NVIDIA 系统上开发训练模型 — HankYeomans · 2026-09-10
- 实测 agent 流量输入输出 token 比 89:1,你的账单大头是 prefill 而非生成 — MotherMouse8132 · 2026-09-10