vLLM 0.25.0 发布
mervenoyann · x · 2026-07-12
vLLM 发布 v0.25.0,这次更新非常大:共有 558 个 commits、232 位贡献者,其中 64 位是新贡献者。
主要变化包括:
- Model Runner V2 成为所有 dense 模型的默认方案
- 旧版 PagedAttention 实现被移除
- Transformers backend 速度已经和原生 vLLM 一样快
- 新的统一 Streaming Parser Engine
- 跨异构词表的通用 speculative decoding(TLI)
- 新增 DSpark 和 DFlash drafter
- 支持新模型 Hy3、Unlimited OCR
这是一次偏底层和工程面的重大版本更新,重点在推理栈性能与架构整合。
所属事件:vLLM 0.25.0 大版本发布:架构升级与多硬件性能优化(5 条相关)→
「Infra」频道最新
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11