vLLM v0.28.0 发布:270 人贡献 584 项提交
vllm_project · x · 2026-08-27
vLLM v0.28.0 正式发布,本周期共 584 项提交、来自 270 位贡献者(76 位新人)。
核心亮点:
- 针对 Kimi-K3 的全栈优化
- DeepSeek-V4 稀疏 MLA 在普通解码、MTP 和 DSpark 场景下端到端可用
- 投机解码新增 DFlash2 和 DSpark 置信度调度验证
- Model Runner V2 支持 E/P/D 分离部署与权重卸载
- 分层 KV 卸载新增磁盘层与树外二级层
- 新模型支持:Muse Glimmer、Ling 3.0 Flash、Dots3 NOTE、Interns2mobius
官方随后以线程形式详细展开了性能、硬件与升级注意事项。
所属事件:vLLM v0.28.0 发布:270 位贡献者带来 584 项提交(3 条相关)→
「Infra」频道最新
- 为提升 SlimServe 性能,开发者修改 Nvidia 驱动解锁 PCIe P2P — QuixiAI · 2026-08-27
- 观点:单人持 200 张 B300 或可战大厂团队 — kalomaze · 2026-08-27
- GLM 5.3 Flash 跑分实测:双 DGX 达 881 tok/s — teortaxesTex · 2026-08-27
- 资深工程师建议:如果你有 CPU 节点,请务必留住 — rakyll · 2026-08-27
- OpenRouter 累计服务 2000B Token,新增 Qwen 3.5 35B — gajesh · 2026-08-27
- 300 美元 AMD 推土机跑 35B 模型:本地 AI 硬件门槛已崩塌 — SimplyAnnisa · 2026-08-27