vLLM 0.28.0 升级指南:Rust 前端与量化支持
vllm_project · x · 2026-08-27
vLLM v0.28.0 发布,在服务端和前端有重要更新:
- E/P/D:移除重复的图像预处理,并迁移至 GPU。
- Rust 前端:新增独立渲染器及通过 gRPC 进行图像推理。
- 量化:在线 MXFP4 量化,以及通过 CUTLASS 实现批处理不变的 NVFP4 MoE。
- 优先级:请求优先级现在可来自 HTTP 头。
- 安全:修复了通过伪造音频采样率进行的 DoS 漏洞。
升级前注意:
- 默认变更:maxnumbatchedtokens 从 8192 提升至 16384;Mamba 模型默认开启前缀缓存。
- 插件化:bitsandbytes 现为树外插件;移除了 calculatekvscales 和 overrideattentiondtype。
- 依赖:升级至 Transformers 5.15.0,运行时镜像迁移至 Ubuntu 24.04。
- 指标重命名:KV 卸载分层指标从 ...block... 重命名为 ...chunk...。
所属事件:vLLM v0.28.0 发布:270 位贡献者带来 584 项提交(3 条相关)→
「Infra」频道最新
- 为提升 SlimServe 性能,开发者修改 Nvidia 驱动解锁 PCIe P2P — QuixiAI · 2026-08-27
- 观点:单人持 200 张 B300 或可战大厂团队 — kalomaze · 2026-08-27
- GLM 5.3 Flash 跑分实测:双 DGX 达 881 tok/s — teortaxesTex · 2026-08-27
- 资深工程师建议:如果你有 CPU 节点,请务必留住 — rakyll · 2026-08-27
- OpenRouter 累计服务 2000B Token,新增 Qwen 3.5 35B — gajesh · 2026-08-27
- 300 美元 AMD 推土机跑 35B 模型:本地 AI 硬件门槛已崩塌 — SimplyAnnisa · 2026-08-27