vLLM 上线 Vera Rubin NVL72 支持,单卡吞吐达 GB200 的 7.8 倍
vllm_project · x · 2026-10-10
vLLM 团队联合 NVIDIA、Red Hat、Inferact 宣布已完成对 NVIDIA Vera Rubin NVL72 的支持,并提供每日构建的容器镜像(vllm/vllm-openai:cu134-nightly),今天即可运行 DeepSeek、Kimi、GLM、MiniMax 等模型。
关键信息:
- 硬件规格:Vera Rubin NVL72 的 NVFP4 算力约为 GB200 NVL72 的 5 倍,HBM 带宽约 2.4 倍,双向 NVLink 带宽 1.7 倍,softmax 所需指数运算快 2-4 倍。
- Day-0 支持:Rubin 延续 Blackwell 架构家族,vLLM 的 Blackwell 内核直接兼容,因此开箱即支持多家开源模型。
- 内核优化:通过 FlashInfer 0.7.0 提供 Rubin 调优的 attention、GEMM 和 MoE 内核,并为 MiniMax Sparse Attention prefill 内核做了专门调优。
- Locality-aware MoE:利用 CUDA 13.4 的 locality domain,将 MoE 的 FC1/FC2 权重按列切分,用 Green Contexts 在各自分区的 SM 上启动内核,让 SM 只读取最近的 HBM,以吃满 Rubin 提升的内存带宽。
- 早期性能:在 AgentX 上相同 interactivity 下,单 GPU 吞吐达 GB200 NVL72 的 7.8 倍;MLPerf 中 VLM 吞吐最高达 GB300 NVL72 的 3.7 倍,且优化仍在进行中。
所属事件:vLLM 完成 Vera Rubin NVL72 支持,吞吐超 GB200 达 7.8 倍(7 条相关)→
「Infra」频道最新
- Fireworks AI 遭内部凭据未授权使用,官方确认安全事件并展开调查 — lqiao · 2026-10-10
- ChapterPal 确认支持 Android 端离线 Gemini Nano,AI 导师可无网使用 — burkov · 2026-10-10
- 对话式 AI 或 1-2 年内过时,Agent 蜂群将推高流量千倍 — dumpshoot · 2026-10-10
- Starship 发射成本有望降至 18.5 万美元,入轨价格缩水百倍 — claud_fuen · 2026-10-10
- 数据中心明星公司 300 亿美元 IPO 梦碎,48 小时内崩塌 — mfiguiere · 2026-10-10
- DuckDB v2.0 CLI 推出 Agent 模式,token 消耗直降 59% — josh_wills · 2026-10-10