vLLM 适配 NVIDIA Vera Rubin,MiniMax M3 吞吐达 GB200 的 7.8 倍
vllm_project · x · 2026-10-10
vLLM 官方宣布已完成对 NVIDIA Vera Rubin 的支持,自 Rubin 发布以来 vLLM 社区与 @inferact、NVIDIA、Red Hat 一直在推进移植。早期基准测试显示,在 SemiAnalysis 的 AgentX 智能体基准上,vLLM 服务 MiniMax M3 于 Vera Rubin NVL72 上可实现同等交互性下超 GB200 7.8 倍的吞吐;MLPerf Inference v6.1 中,vLLM 搭配 Dynamo 在 Qwen3-VL-235B-A22B 上达到 GB300 NVL72 最高 3.7 倍吞吐。
所属事件:vLLM 完成 Vera Rubin NVL72 支持,吞吐超 GB200 达 7.8 倍(7 条相关)→
「Infra」频道最新
- 清华 TokenRouter 论文:token 级大小模型路由,吞吐最高提升 64 倍 — rohanpaul_ai · 2026-10-10
- 开发者给 Meta Muse 配免费模型池自动路由,长任务零成本跑 — sven_ai · 2026-10-10
- 网友自组混合部署 DeepSeek:GPU+CPU 专家+SSD,TTFT 从75秒降到8.9秒 — HankYeomans · 2026-10-10
- vLLM 线程(4/5):用 locality domain 优化 MoE,decode 提速 1.2 倍 — vllm_project · 2026-10-10
- AMD 联手 ai& 办东京黑客松:4.5 小时用 Kimi、GLM、Qwen、MiniMax 搭建 — DavidBennett__ · 2026-10-10
- 芝加哥市中心将建 AI 数据中心,空置写字楼迎来新用途 — willcb · 2026-10-10