vLLM 线程(3/5):Rubin 对比 GB200,FP4 算力 3.5 倍、HBM 带宽 2.4 倍

vllm_project · x · 2026-10-10

vLLM 线程第三部分给出 Rubin 与 GB200 的硬件对比:FP4 FLOPS 达 3.5 倍,HBM 带宽约 2.4 倍,NVLink 带宽 1.7 倍,softmax 指数运算快 2-4 倍;更强的 NVLink 降低了 MoE 服务中 AllReduce 和 all-to-all 的成本。vLLM 的 Blackwell kernel 无需修改即可在 Rubin 上运行,FlashInfer 0.7.0 则新增了针对 Rubin 调优的 attention、GEMM 和 MoE kernel。

所属事件:vLLM 完成 Vera Rubin NVL72 支持,吞吐超 GB200 达 7.8 倍(7 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →