NVIDIA 公布 Qwen3.8-2.4T 模型部署方案:GB300 显卡吞吐超 4000 tokens/s
PyTorch · x · 2026-08-21
NVIDIA 发布技术博客,详细介绍如何在其 NVIDIA GB300 NVL72 平台上部署阿里巴巴最新发布的开源大模型 Qwen3.8-2.4T-A95B。
- 模型规格:该模型拥有 2.4 万亿总参数,每个 token 激活 950 亿参数,采用 MoE 架构与混合注意力机制,支持 100 万 token 上下文。
- 部署性能:在未进行额外调优的情况下,模型在 FP8 精度下可实现每块 GPU 超过 4000 tokens/s 的吞吐量,每用户超过 350 tokens/s。
- 工程实践:开发者可以使用 PyTorch 原生微调库和 NVIDIA NeMo AutoModel,直接在现有检查点上进行 SFT 或 LoRA 微调,无需模型转换。
「Infra」频道最新
- Payman 发布 Connect:让 AI 安全代理银行账户转账 — minsuk_chang · 2026-08-21
- alt-p2p-http:本地 LLM 端对端加密隧道工具 — agf2007 · 2026-08-21
- 开源 INVAR:给本地 LLM 每次推理发 SHA-256 可复现回执 — revuprender · 2026-08-21
- SpaceX 发射频率或助太空算力达 12-50GW — teortaxesTex · 2026-08-21
- 本地 AI 编码硬件分级:1000 美元起跑 27B 模型 — nickbaumann_ · 2026-08-21
- Cerebras 高管申报出售 1.53 亿美元股票,IPO 追高散户被重创 — firstadopter · 2026-08-21