升级前必读:vLLM v0.29.0 移除十个弃用架构,默认行为多处变更
vllm_project · x · 2026-09-11
vLLM v0.29.0 升级注意事项:
- 新默认:所有模型启用 MRV2,TP CUDA 组默认 FlashInfer all-reduce,SWA/SSM 模型的 prefixcacheretentioninterval 置 0
- 部分尚不支持的 ROCm 模型与功能仍保留 MRV1
- Prefix-cache NONEHASH 已确定性化,分布式 KV cache 用户可去掉 PYTHONHASHSEED
- 移除十个弃用架构;FlexOlmo、Olmo3、Hunyuan V1/VL 转 Transformers 后端
- 移除 PyAV 视频解码器,改用 OpenCV 或 Torchcodec
- python -m vllm.entrypoints.openai.apiserver 弃用,改用 vllm serve
服务端与前端亮点:Mooncake Store 支持 decode KV offload;新增队列准入控制参数 --max-num-queued-reqs/--max-num-queued-tokens;新增 Anthropic Messages API 的 /v1/messages/render 端点;Rust 前端 gRPC 支持音视频输入;cachesalt 长度加限,修复调度器 CPU 耗尽 DoS。
所属事件:vLLM v0.29.0发布:Blackwell延迟降33.6%,277人参与(4 条相关)→
「Infra」频道最新
- KV缓存9个月压缩54倍,DeepSeek被称第三前沿实验室 — max_paperclips · 2026-09-11
- CXMT 激进扩产:至 2028 下半年新建四座 DRAM 晶圆厂 — zephyr_z9 · 2026-09-11
- OpenAI CFO:一年前买的算力如今可溢价 3-5 倍卖出 — rohanpaul_ai · 2026-09-11
- NVIDIA 与 Red Hat 联手 vLLM 设 bounty:33B 以下开源模型实战黑客松 — NVIDIAAI · 2026-09-11
- 开发者质疑 OpenAI prompt_cache_key 设计或致算力大量浪费 — YouJiacheng · 2026-09-11
- SF Compute 签下 2.45 亿美元 Blackwell B300 算力长约 — mattshumer_ · 2026-09-11