Vera Rubin NVL72 MLPerf 首秀:吞吐最高达 GB300 的 3.7 倍
NVIDIA Blog · rss · 2026-09-16
NVIDIA 发布 MLPerf Inference v6.1 成绩:- Vera Rubin NVL72 预览提交首秀,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,DeepSeek-R1 上达 2.5 倍,采用 vLLM + Dynamo 与 TensorRT-LLM,借助 NVFP4 精度、 disaggregated serving 与大规模专家并行;- GB300 NVL72 从 1 机架(72 GPU)扩展到 4 机架(288 GPU)达 99% 扩展效率;- 软件优化使 v6.1 较 v6.0 性能最高提升 1.6 倍;- SemiAnalysis AgentX 智能体基准上 Vera Rubin 预览成绩达 GB300 的 30 倍;19 家合作伙伴参与提交。
「Infra」频道最新
- 芯片演进三阶段论:2015年后CMOS缩放只剩能效红利 — blelbach · 2026-09-17
- 开发者做了 GGUF 显存计算器:输入显卡即可知道哪个量化能跑 — asankhs · 2026-09-17
- 摩尔定律三阶段:1970 免费午餐到 2015 后的软件地狱 — blelbach · 2026-09-17
- 96GB M3 Ultra 跑什么?Qwen3.5-122B-A10B 达约 1000 tok/s — infieldmitt · 2026-09-17
- llama.cpp 加载 Qwen3.8 MTP 草稿模型报错,tensor 缺失无解 — Ambitious_Fold_2874 · 2026-09-17
- 预测:18个月内Kimi K3级智能将跑在单张RTX 5090上 — TheZachMueller · 2026-09-17