vLLM v0.30 发布:762 commits 支持 DeepSeek-V4.1-Flash,Gemma 4 多模态提速 3.23 倍

vllm_project · x · 2026-09-23

vLLM 项目发布 v0.30.0,共收录 762 个提交、315 位贡献者(104 位首次参与)。

新模型支持

性能优化

快速启动:新增常驻权重缓存守护进程,重启引擎经 CUDA IPC 映射 GPU 中的量化分片权重(--load-format ipccache),不再从磁盘重载,已支持 FP4 与多节点 TP。

升级注意:scale-out 端点改为 --enable-scale-out 显式开启,GPTQ gidx 已移除,Mamba cache 弃用,YaRN 可能缩短 maxmodellen,默认音频重采样器改为 torchaudio。另新增 Gumbel-max 水印生成与检测。

所属事件:vLLM v0.30.0 发布:762 次提交带来多项性能优化(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →