vLLM 线程(3/5):Rubin 对比 GB200,FP4 算力 3.5 倍、HBM 带宽 2.4 倍
vllm_project · x · 2026-10-10
vLLM 线程第三部分给出 Rubin 与 GB200 的硬件对比:FP4 FLOPS 达 3.5 倍,HBM 带宽约 2.4 倍,NVLink 带宽 1.7 倍,softmax 指数运算快 2-4 倍;更强的 NVLink 降低了 MoE 服务中 AllReduce 和 all-to-all 的成本。vLLM 的 Blackwell kernel 无需修改即可在 Rubin 上运行,FlashInfer 0.7.0 则新增了针对 Rubin 调优的 attention、GEMM 和 MoE kernel。
所属事件:vLLM 完成 Vera Rubin NVL72 支持,吞吐超 GB200 达 7.8 倍(7 条相关)→
「Infra」频道最新
- ChapterPal 确认支持 Android 端离线 Gemini Nano,AI 导师可无网使用 — burkov · 2026-10-10
- 对话式 AI 或 1-2 年内过时,Agent 蜂群将推高流量千倍 — dumpshoot · 2026-10-10
- Starship 发射成本有望降至 18.5 万美元,入轨价格缩水百倍 — claud_fuen · 2026-10-10
- 数据中心明星公司 300 亿美元 IPO 梦碎,48 小时内崩塌 — mfiguiere · 2026-10-10
- DuckDB v2.0 CLI 推出 Agent 模式,token 消耗直降 59% — josh_wills · 2026-10-10
- MosaicML Streaming 作者背书,Datology 发布确定性数据加载器 Zephon — josh_wills · 2026-10-10