vLLM 0.25.0 发布
vllm_project · x · 2026-07-12
vLLM 发布 v0.25.0,这次有 558 个 commits、232 位贡献者参与,其中 64 位是新贡献者。
主要变化包括:
- Model Runner V2 成为所有 dense 模型的默认执行路径
- PagedAttention 旧实现被移除,V1/MRv2 现在是标准路径
- Transformers 后端速度提升到接近原生 vLLM
- 新增统一的 Streaming Parser Engine
- 支持跨异构词表的通用 speculative decoding(TLI),并加入 DSpark、DFlash 两种 drafter
- 新增/更新了多个模型,如 Hy3、Unlimited OCR、LLaVA-OneVision-2、MOSS-Transcribe-Diarize、openai/privacy-filter、GLM-5、DeepSeek-V3.2、MiniMax-M3 等
所属事件:vLLM 0.25.0 大版本发布:架构升级与多硬件性能优化(5 条相关)→
「Infra」频道最新
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11