vLLM 适配 NVIDIA Vera Rubin:吞吐量达 GB200 的 7.8 倍

woosuk_k · x · 2026-10-10

vLLM 宣布完成对 NVIDIA Vera Rubin 的早期适配:在匹配交互性(interactivity)的条件下,运行 MiniMax M3 于 Vera Rubin NVL72 上的吞吐量达到 GB200 的 7.8 倍以上,测试基于 AgentX 基准。Inferact 团队自 Rubin 发布以来参与共建,已集成针对 Rubin 优化的 MSA prefill kernel,并做了 locality-aware 的性能调优。团队强调这是早期结果。

所属事件:vLLM 完成 Vera Rubin NVL72 支持,吞吐超 GB200 达 7.8 倍(7 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →