vLLM 0.28.0 性能详情:Kimi-K3 优化与硬适配
vllm_project · x · 2026-08-27
vLLM v0.28.0 发布,带来了显著的性能提升与硬件适配:
- Kimi-K3:自适应推测 Token 预算提升 5565% 的 E2E TTFT;可选的共享专家分片每 GPU 节省约 17 GiB 显存。
- 序列并行:合并 all-gathers 操作,内核层面提升 1.53 倍速度。
- NVIDIA:FlashInfer XQA 解码支持 SM12x;SM90 原生 DSA 路径支持 MTP=3。
- AMD ROCm:支持 torch 2.12 / triton 3.7,新增融合 Kimi-K3 KDA 解码内核。
- Intel XPU:新增带分块 GEMM 的 torch linear 后端,XPU 轮子正在发布流程中。
- CPU:新增 MLA 后端,支持 DeepSeek-V2/V3 在 CPU 上运行。
所属事件:vLLM v0.28.0 发布:270 位贡献者带来 584 项提交(3 条相关)→
「Infra」频道最新
- 为提升 SlimServe 性能,开发者修改 Nvidia 驱动解锁 PCIe P2P — QuixiAI · 2026-08-27
- 观点:单人持 200 张 B300 或可战大厂团队 — kalomaze · 2026-08-27
- GLM 5.3 Flash 跑分实测:双 DGX 达 881 tok/s — teortaxesTex · 2026-08-27
- 资深工程师建议:如果你有 CPU 节点,请务必留住 — rakyll · 2026-08-27
- OpenRouter 累计服务 2000B Token,新增 Qwen 3.5 35B — gajesh · 2026-08-27
- 300 美元 AMD 推土机跑 35B 模型:本地 AI 硬件门槛已崩塌 — SimplyAnnisa · 2026-08-27