vLLM 适配 NVIDIA Vera Rubin,MiniMax M3 吞吐达 GB200 的 7.8 倍

vllm_project · x · 2026-10-10

vLLM 官方宣布已完成对 NVIDIA Vera Rubin 的支持,自 Rubin 发布以来 vLLM 社区与 @inferact、NVIDIA、Red Hat 一直在推进移植。早期基准测试显示,在 SemiAnalysis 的 AgentX 智能体基准上,vLLM 服务 MiniMax M3 于 Vera Rubin NVL72 上可实现同等交互性下超 GB200 7.8 倍的吞吐;MLPerf Inference v6.1 中,vLLM 搭配 Dynamo 在 Qwen3-VL-235B-A22B 上达到 GB300 NVL72 最高 3.7 倍吞吐。

所属事件:vLLM 完成 Vera Rubin NVL72 支持,吞吐超 GB200 达 7.8 倍(7 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →