vLLM v0.29.0发布:Blackwell延迟降33.6%,277人参与
vLLM 发布 v0.29.0,由 277 位贡献者(91 位首次参与)的 594 次提交组成。性能方面,Blackwell 端到端延迟降低 33.6%,Kimi-K3 的 Mamba metadata prep 合并为单次 Triton launch 带来内核级最高约 7 倍提速;Model Runner V2 成为所有模型默认。新版本还引入 Mooncake Store 的 decode KV 卸载、队列准入控制参数等,并移除十个弃用架构,默认行为多处变更,官方提醒升级前务必阅读注意事项。
2026-09-11 ~ 2026-09-11 · 4 条相关
- vLLM v0.29.0 发布:Model Runner V2 成全模型默认,277 人贡献 594 次提交 — vllm_project · 2026-09-11
- vLLM v0.29.0 性能升级:Blackwell 端到端延迟降 33.6%,内核级提速 7 倍 — vllm_project · 2026-09-11
- vLLM 升级要点:KV 卸载、队列控制与 Blackwell 延迟降 33.6% — vllm_project · 2026-09-11
- 升级前必读:vLLM v0.29.0 移除十个弃用架构,默认行为多处变更 — vllm_project · 2026-09-11