vLLM v0.29.0 性能升级:Blackwell 端到端延迟降 33.6%,内核级提速 7 倍
vllm_project · x · 2026-09-11
vLLM 官方发布 v0.29.0 性能与硬件优化汇总:
- Kimi-K3:Mamba metadata prep 合并为单次 Triton launch,内核级提速 6.67.6x
- 批次不变性:按架构逐个调优,RTX 4090D / H20 上解码内核约 3x 提速
- Blackwell 自动调优:端到端延迟降低 33.6%
- NVIDIA:DeepSeek V3.2 与 GLM-5.2 的 DSA 注意力在每款 GPU 上都走 CUDA 实现
- AMD ROCm:W4A4 默认使用预重排 asm GEMM;ROCr/CLR 基础镜像修复 graph replay 段错误,并发 1 时 TPOT 最高改善约 20%
- CPU:新增 AMX MLA 后端,DeepSeek V2/V3/R1 可端到端运行
- Intel XPU:新增 INC int4 W4A8 linear 后端与 AutoRound MXFP8 MoE 支持
所属事件:vLLM v0.29.0发布:Blackwell延迟降33.6%,277人参与(4 条相关)→
「Infra」频道最新
- SF Compute 签下 2.45 亿美元 Blackwell B300 算力长约 — mattshumer_ · 2026-09-11
- 马斯克转发 SpaceX CFO 演讲纪要:垂直整合+轨道算力布局 — elonmusk · 2026-09-11
- 贝索斯:电力供应链成瓶颈,算力滞后迫使各实验室放慢研发 — beffjezos · 2026-09-11
- 一个芝士汉堡的碳排放约等于 6.3 万次 Gemini 提问 — recallingmemories · 2026-09-11
- 谷歌签下一座核电站一半的电力,专为 AI 数据中心供能 — lukaspetersson · 2026-09-11
- 传 spcx 一周前再签超大算力协议,ARR 达 130 亿美元 — rwang07 · 2026-09-11