vLLM 适配 Vera Rubin NVL72:吞吐达 GB200 的 7.8 倍

Xianbao_QIAN · x · 2026-10-10

vLLM 团队与 NVIDIA、Red Hat、Inferact 合作完成对 NVIDIA Vera Rubin NVL72 的适配,这是为智能体推理打造的下一代平台。

硬件规格:相较 GB200 NVL72,NVFP4 算力提升 5 倍,HBM 带宽约 2.4 倍,NVLink 双向带宽 1.7 倍,softmax 指数运算快 2-4 倍。

Day-0 支持:Rubin 延续 Blackwell 架构家族,vLLM 的 Blackwell 内核可直接兼容,已支持 DeepSeek、Kimi、GLM、MiniMax 等模型。

优化手段:

早期性能:在同等交互性下,AgentX 上每 GPU 吞吐达 GB200 NVL72 的 7.8 倍;MLPerf 中 VLM 吞吐较 GB300 NVL72 最高提升 3.7 倍。优化仍在继续。

所属事件:vLLM 完成 Vera Rubin NVL72 支持,吞吐超 GB200 达 7.8 倍(7 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →