Vera Rubin NVL72 MLPerf 首秀:吞吐最高达 GB300 的 3.7 倍

NVIDIA Blog · rss · 2026-09-16

NVIDIA 发布 MLPerf Inference v6.1 成绩:- Vera Rubin NVL72 预览提交首秀,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,DeepSeek-R1 上达 2.5 倍,采用 vLLM + Dynamo 与 TensorRT-LLM,借助 NVFP4 精度、 disaggregated serving 与大规模专家并行;- GB300 NVL72 从 1 机架(72 GPU)扩展到 4 机架(288 GPU)达 99% 扩展效率;- 软件优化使 v6.1 较 v6.0 性能最高提升 1.6 倍;- SemiAnalysis AgentX 智能体基准上 Vera Rubin 预览成绩达 GB300 的 30 倍;19 家合作伙伴参与提交。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →