vLLM 升级要点:KV 卸载、队列控制与 Blackwell 延迟降 33.6%
vllm_project · x · 2026-09-11
vLLM 项目官方发布升级前须知,涵盖服务、前端与性能改进:
服务与前端
- Mooncake Store 支持 decode KV 卸载
- 新增队列准入控制参数 --max-num-queued-reqs 与 --max-num-queued-tokens
- 新增 /v1/messages/render 端点,支持 Anthropic Messages API
- Rust 前端经 gRPC 支持音频与视频输入
- cachesalt 长度加入上限,修复一个可耗尽调度器 CPU 的 DoS 漏洞
性能与硬件
- Kimi-K3 Mamba 元数据准备合并为单次 Triton launch,内核级提速 6.67.6 倍
- 按架构调优 batch invariance:RTX 4090D / H20 上 decode 内核约 3 倍提升
- Blackwell 自动调优使端到端延迟降低 33.6%
- NVIDIA:DeepSeek V3.2 与 GLM-5.2 DSA 在每款 GPU 上达到 CUDA 实现;AMD ROCm 的 W4A4 默认使用预洗牌 asm GEMM
所属事件:vLLM v0.29.0发布:Blackwell延迟降33.6%,277人参与(4 条相关)→
「Infra」频道最新
- SF Compute 签下 2.45 亿美元 Blackwell B300 算力长约 — mattshumer_ · 2026-09-11
- 马斯克转发 SpaceX CFO 演讲纪要:垂直整合+轨道算力布局 — elonmusk · 2026-09-11
- 贝索斯:电力供应链成瓶颈,算力滞后迫使各实验室放慢研发 — beffjezos · 2026-09-11
- vLLM v0.29.0 性能升级:Blackwell 端到端延迟降 33.6%,内核级提速 7 倍 — vllm_project · 2026-09-11
- 一个芝士汉堡的碳排放约等于 6.3 万次 Gemini 提问 — recallingmemories · 2026-09-11
- 谷歌签下一座核电站一半的电力,专为 AI 数据中心供能 — lukaspetersson · 2026-09-11