vLLM 发布 0.25.0
vllm_project · x · 2026-07-12
vLLM 官方发布 v0.25.0,并称这是一次包含 558 个 commits、232 位贡献者 的大版本更新。
核心亮点:
- Model Runner V2 成为所有 dense 模型的默认执行路径
- 旧版 PagedAttention 被退休
- Transformers backend 速度提升到接近原生 vLLM
- 新增统一的 Streaming Parser Engine
- 引入跨异构词表的通用 speculative decoding(TLI)以及新的 DSpark、DFlash drafter
- 新增模型支持,包括 Hy3 和 Unlimited OCR
这条是 vLLM 这次升级的主发布信息,后续更细的 serving / hardware 说明都围绕它展开。
所属事件:vLLM 0.25.0 大版本发布:架构升级与多硬件性能优化(5 条相关)→
「Infra」频道最新
- AI 工程师必懂的 12 种 KV Cache 压缩技术一文讲透 — blaizedsouza · 2026-09-11
- 影子算力市场走向台前,Meta 对外出售过剩 GPU 算力成标志性信号 — DavidLinthicum · 2026-09-11
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11