vLLM v0.30 发布:762 commits 支持 DeepSeek-V4.1-Flash,Gemma 4 多模态提速 3.23 倍
vllm_project · x · 2026-09-23
vLLM 项目发布 v0.30.0,共收录 762 个提交、315 位贡献者(104 位首次参与)。
新模型支持
- DeepSeek-V4.1-Flash:KV 全量存于 MXFP8,基于 FlashMLA V4.1 刷新 SM100 纪录,含 DeepGEMM Mega-mHC 与异步 Engram 预取
- DeepSeek-V4-Flash-Vision-Exp(支持 ROCm 与 LoRA)
- GLM-5.3-Flash(含 EPLB)、K2-Horizon、Cohere Compass、Bailing V3 VL、Nanbeige4.2
- DeepSeek-V4 CPU 后端:AVX512/AMX sparse MLA 等内核
性能优化
- RL 采样掩码:GPU compaction 使 512 并发下吞吐回到无掩码的 2–3% 以内,修复约 2 倍的步时回退
- Kimi K3 混合 batch:E2E 吞吐提升 5.2–7.7%
- Gemma 4 多模态前缀:RTX PRO 6000 上 3.23 倍 E2E 加速
- AMD ROCm packed W4A16:Gemma 4 AWQ 的中位 TPOT 降低 26.4%
快速启动:新增常驻权重缓存守护进程,重启引擎经 CUDA IPC 映射 GPU 中的量化分片权重(--load-format ipccache),不再从磁盘重载,已支持 FP4 与多节点 TP。
升级注意:scale-out 端点改为 --enable-scale-out 显式开启,GPTQ gidx 已移除,Mamba cache 弃用,YaRN 可能缩短 maxmodellen,默认音频重采样器改为 torchaudio。另新增 Gumbel-max 水印生成与检测。
所属事件:vLLM v0.30.0 发布:762 次提交带来多项性能优化(3 条相关)→
「Infra」频道最新
- tinygrad 在 MI300X 上跑出 MiMo-V2.6-Pro 约 200 tok/s — AIFlow_ML · 2026-09-23
- 爆料:64GB 版 RTX 5090 研发中,但短期内难上市 — AIFlow_ML · 2026-09-23
- Swarm 推出 Qwen Image-2.1 推理引擎:1K 图生成仅 0.5 秒 — bingxu_ · 2026-09-23
- MTP 头被静默忽略:修复三行代码让 Mac 本地解码提速 63%-79% — Micha0827 · 2026-09-23
- 开源自托管备份方案Pluton:Restic+Rclone加密备份跨云复制 — tom_doerr · 2026-09-23
- TensorSharp 直读 label logits,结构化决策比 LocalJev 快 3.3 倍 — fuzhongkai · 2026-09-23