vLLM 完成 Vera Rubin NVL72 支持,吞吐超 GB200 达 7.8 倍
vLLM 官方宣布已完成对 NVIDIA Vera Rubin NVL72 的支持。自 Rubin 发布以来,vLLM 社区与 Inferact、NVIDIA、Red Hat 持续推进移植,现已提供每日构建的容器镜像(vllm/vllm-openai:cu134-nightly),当天即可运行。官方同时披露了多项基准数据,SemiAnalysis 也给出独立的经济学分析,量化了 Rubin 相对现有旗舰平台的收益。
已确认
- 在 SemiAnalysis AgentX 基准上,vLLM 服务 MiniMax M3 于 Vera Rubin NVL72 在同等交互性(interactivity)条件下,吞吐量超过 GB200 的 7.8 倍;vLLM 官方线程第二部分还披露了 MLPerf Inference 基准成绩。
- 硬件对比(vLLM 官方线程):相较 GB200 NVL72,FP4 FLOPS 达 3.5 倍,HBM 带宽约 2.4 倍,NVLink 带宽 1.7 倍,softmax 指数运算快 2-4 倍;更强的 NVLink 降低了 MoE(专家并行)通信开销。
- SemiAnalysis 分析称,Rubin 平台在生产级推理引擎 vLLM 上每吉瓦利润较 GB300 NVL72 提升 3.2 倍,每美元性能最高提升 10 倍。
为什么重要
- Rubin NVL72 被定位为面向智能体推理打造的下一代平台,vLLM 在其发布初期即完成适配并给出可复现的基准数据,显示开源推理栈与新硬件的协同节奏显著加快。
- SemiAnalysis 的每吉瓦利润与每美元性能指标,为数据中心级别的采购与部署决策提供了量化参考。
2026-10-10 ~ 2026-10-10 · 7 条相关
一手来源
- vLLM 适配 NVIDIA Vera Rubin,MiniMax M3 吞吐达 GB200 的 7.8 倍 — vllm_project ·
- vLLM 上线 Vera Rubin NVL72 支持,单卡吞吐达 GB200 的 7.8 倍 — vllm_project ·
- vLLM 线程(3/5):Rubin 对比 GB200,FP4 算力 3.5 倍、HBM 带宽 2.4 倍 — vllm_project ·
- SemiAnalysis:Rubin 搭 vLLM 每吉瓦利润较 GB300 NVL72 高 3.2 倍 — woosuk_k · 2026-10-10
- 【源头】vLLM 适配 NVIDIA Vera Rubin,MiniMax M3 吞吐达 GB200 的 7.8 倍 — vllm_project · 2026-10-10
- vLLM 线程(2/5):Rubin NVL72 两项基准成绩详解 — vllm_project · 2026-10-10
- 【源头】vLLM 线程(3/5):Rubin 对比 GB200,FP4 算力 3.5 倍、HBM 带宽 2.4 倍 — vllm_project · 2026-10-10
- 【源头】vLLM 上线 Vera Rubin NVL72 支持,单卡吞吐达 GB200 的 7.8 倍 — vllm_project · 2026-10-10
另有 2 条近重复转述:Xianbao_QIAN · woosuk_k