vLLM 0.25.0 大版本发布:架构升级与多硬件性能优化

vLLM 官方正式发布了 0.25.0 版本,这是一次规模庞大的里程碑式更新。据统计,本次大版本迭代共包含 558 个 commits,吸引了 232 位贡献者参与,其中 64 位是新加入的贡献者。此次更新不仅涉及核心执行架构的调整,还带来了广泛的硬件适配优化和工程部署层面的改进。

核心架构与执行路径

本次更新在模型执行层面的最大变化是 Model Runner V2 正式成为所有 dense(稠密)模型的默认执行路径,同时旧版的执行路径被废弃。这一变动意味着 vLLM 在底层调度与推理逻辑上进行了重要迭代。

多硬件平台性能优化

针对不同的底层硬件,vLLM 0.25.0 引入了细致的性能调优。在 NVIDIA 平台方面,FlashInfer 的 fused all-reduce 专门针对 GB300 进行了调优,并完善了对 Blackwell 架构的支持。此外,本次更新也同步包含了针对 AMD 等其他硬件平台的针对性优化措施。

服务端与分布式部署改进

在工程部署与 serving 方面,0.25.0 版本实施了多项底层重构。在分布式部署上,sequence parallelism 不再强制要求 DP(数据并行),该改进使端到端吞吐量提升了约 1.9% 至 5.0%。此外,官方也对 NCCL 相关设置和前端组件进行了调整与升级,以提供更稳健的服务端支持。

2026-07-12 ~ 2026-07-12 · 5 条相关

一手来源

另有 1 条近重复转述:vllm_project