vLLM v0.29.0 upgrade guide: new defaults, ten architectures removed, DoS fix

vllm_project · x · 2026-09-11

Key upgrade notes for vLLM v0.29.0:

Serving/frontend highlights: Mooncake Store can offload decode KV; queue admission control via --max-num-queued-reqs/--max-num-queued-tokens; a /v1/messages/render endpoint for the Anthropic Messages API; Rust frontend adds audio/video over gRPC; bounded cachesalt length closes a scheduler CPU exhaustion DoS.

Related event: vLLM v0.29.0 Cuts Blackwell Latency 33.6%, Model Runner V2 Default(4 posts)→

Original post →

More from Infra

Infra channel →