vLLM v0.30.0 发布:762 次提交,多项推理性能优化
vllm_project · x · 2026-09-23
开源推理引擎 vLLM 发布 v0.30.0,共 762 次提交、315 位贡献者(含 104 位首次贡献者)。主要更新:
- 混合注意力热路径优化:Kimi K3 精简 KDA/AtRes/MLA,DeepSeek-V4.1-Flash 增加 MXFP8 KV 与异步 Engram,Qwen3.8-Flash-Next 融合 QSA/PLE 降低 sparse-GQA 开销
- HiSparse:在 sparse-MLA 解码下新增主机层,GPU 压力大时仅 top-k 未命中才回退到每请求热缓冲
- Model Runner V2:为流水线并行带来 EAGLE3 风格草稿,并通过在线接受率估计把自适应验证扩展到所有草稿模型投机器
- 水印生成与检测:双密钥 Gumbel-max 水印,支持每请求退出与投机解码
- 新模型支持:GLM-5.3-Flash、K2-Horizon、Cohere Compass、Bailing V3 VL
- Fast Start:量化分片权重常驻每 GPU 守护进程,重启经 CUDA IPC 映射,--load-format ipccache
所属事件:vLLM v0.30.0 发布:762 次提交带来多项性能优化(3 条相关)→
「Infra」频道最新
- 曝 Anthropic 洽租阿波罗系数据中心至多 1GW 算力 — rohanpaul_ai · 2026-09-23
- 曝 Anthropic 拟向 Apollo 旗下数据中心租赁最多 1GW 算力 — rohanpaul_ai · 2026-09-23
- 推理服务创业实测:能持续改进模型的训练能力才能留住客户 — ypatil125 · 2026-09-23
- M6 芯片 ANE 内存带宽超 150GB/s,可媲美 GPU/CPU — AIFlow_ML · 2026-09-23
- 报道称 Anthropic 谈判锁定更多数据中心算力 — pstAsiatech · 2026-09-23
- 网友算账:MiMo 论文 127 万条 rollout 轨迹,或只需 10 小时算力 — teortaxesTex · 2026-09-23