vLLM v0.30.0 发布:762 次提交带来多项性能优化

开源推理引擎 vLLM 发布 v0.30.0,共收录 762 个提交、315 位贡献者,其中 104 位为首次参与。版本新增对 DeepSeek-V4.1-Flash 等模型的支持,并带来多项可量化优化:Gemma 4 多模态推理提速 3.23 倍,混合注意力热路径针对 Kimi K3 场景精简,RL 采样掩码经 GPU 压缩后在 512 请求下吞吐可恢复至无掩码水平的 2-3% 以内。

2026-09-23 ~ 2026-09-23 · 3 条相关