vLLM 升级涉及服务端大改
vllm_project · x · 2026-07-12
这是 vLLM 0.25.0 的 serving、frontend 和升级注意事项,信息偏工程部署:
- 分布式:sequence parallelism 不再要求 DP,端到端吞吐提升约 1.9–5.0%;NCCL symmetric memory 扩展到 AllGather / ReduceScatter;all2all 增加 fault tolerance,避免输出损坏
- PD disaggregation:加入 secondary KV tier,并支持 Mooncake connector;覆盖 GDN(Qwen3.5)与 MLA(DeepSeek-V4-Flash)
- Streaming Parser Engine:统一 tool-call 与 reasoning parsing,并新增 Kimi k2.5 / k2.6 / k2.7 parser
- Rust frontend:增加 HTTPS/mTLS、DP supervisor 和 profiler control routes
- 量化:支持 2/3/5/6/7-bit weight-only inference(Humming),以及 Triton INT4 per-token-head KV cache quantization
- 安全修复:增加 image decompression-bomb DoS guard、修复 NaN-audio 导致的无限循环、限制 tokenizer 工作量
另外,升级前需要注意:旧版 PagedAttention 已删除,V1/MRv2 现在是标准路径,部分模型也已从支持列表中移除。
所属事件:vLLM 0.25.0 大版本发布:架构升级与多硬件性能优化(5 条相关)→
「Infra」频道最新
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11