vLLM 适配 NVIDIA Vera Rubin:吞吐量达 GB200 的 7.8 倍
woosuk_k · x · 2026-10-10
vLLM 宣布完成对 NVIDIA Vera Rubin 的早期适配:在匹配交互性(interactivity)的条件下,运行 MiniMax M3 于 Vera Rubin NVL72 上的吞吐量达到 GB200 的 7.8 倍以上,测试基于 AgentX 基准。Inferact 团队自 Rubin 发布以来参与共建,已集成针对 Rubin 优化的 MSA prefill kernel,并做了 locality-aware 的性能调优。团队强调这是早期结果。
所属事件:vLLM 完成 Vera Rubin NVL72 支持,吞吐超 GB200 达 7.8 倍(7 条相关)→
「Infra」频道最新
- 对话式 AI 或 1-2 年内过时,Agent 蜂群将推高流量千倍 — dumpshoot · 2026-10-10
- Starship 发射成本有望降至 18.5 万美元,入轨价格缩水百倍 — claud_fuen · 2026-10-10
- 数据中心明星公司 300 亿美元 IPO 梦碎,48 小时内崩塌 — mfiguiere · 2026-10-10
- DuckDB v2.0 CLI 推出 Agent 模式,token 消耗直降 59% — josh_wills · 2026-10-10
- MosaicML Streaming 作者背书,Datology 发布确定性数据加载器 Zephon — josh_wills · 2026-10-10
- 8张T4跑Qwen3.5-9B:44槽位实测延迟瓶颈在哪 — exaknight21 · 2026-10-10