vLLM 适配 Vera Rubin NVL72:吞吐达 GB200 的 7.8 倍
Xianbao_QIAN · x · 2026-10-10
vLLM 团队与 NVIDIA、Red Hat、Inferact 合作完成对 NVIDIA Vera Rubin NVL72 的适配,这是为智能体推理打造的下一代平台。
硬件规格:相较 GB200 NVL72,NVFP4 算力提升 5 倍,HBM 带宽约 2.4 倍,NVLink 双向带宽 1.7 倍,softmax 指数运算快 2-4 倍。
Day-0 支持:Rubin 延续 Blackwell 架构家族,vLLM 的 Blackwell 内核可直接兼容,已支持 DeepSeek、Kimi、GLM、MiniMax 等模型。
优化手段:
- 通过 FlashInfer 0.7.0 提供 Rubin 调优的 attention/GEMM/MoE 内核
- 针对 Rubin 调优 MiniMax Sparse Attention(MSA)prefill 内核
- 利用 CUDA 13.4 的 locality domains 做 locality-aware MoE 权重切分,让 SM 只读最近内存,吃满提升的 HBM 带宽
早期性能:在同等交互性下,AgentX 上每 GPU 吞吐达 GB200 NVL72 的 7.8 倍;MLPerf 中 VLM 吞吐较 GB300 NVL72 最高提升 3.7 倍。优化仍在继续。
所属事件:vLLM 完成 Vera Rubin NVL72 支持,吞吐超 GB200 达 7.8 倍(7 条相关)→
「Infra」频道最新
- ChapterPal 确认支持 Android 端离线 Gemini Nano,AI 导师可无网使用 — burkov · 2026-10-10
- 对话式 AI 或 1-2 年内过时,Agent 蜂群将推高流量千倍 — dumpshoot · 2026-10-10
- Starship 发射成本有望降至 18.5 万美元,入轨价格缩水百倍 — claud_fuen · 2026-10-10
- 数据中心明星公司 300 亿美元 IPO 梦碎,48 小时内崩塌 — mfiguiere · 2026-10-10
- DuckDB v2.0 CLI 推出 Agent 模式,token 消耗直降 59% — josh_wills · 2026-10-10
- MosaicML Streaming 作者背书,Datology 发布确定性数据加载器 Zephon — josh_wills · 2026-10-10