vLLM 硬核复盘:管线并行遇热缓存失效,Kimi K3 解码吞吐 2.7 倍

vllm_project · x · 2026-09-09

vLLM 项目分享推理服务栈的三层工程经验:

KV 缓存管理:为 DeepSeek V4 采用紧凑 KV 布局,节省约 10% KV 内存,并把每 block 的 92 个张量压缩到 1 个。

并行策略要跟着模型注意力结构走:解码上下文并行在 Kimi K3 上以相同 TPOT 拿到 2.7 倍解码吞吐;预填上下文并行让 DeepSeek V4 的稀疏 MLA 快 2.65 倍;但同一策略在 DeepSeek V4 上仅与 DEP 持平。

调度经验:管线并行在冷长 prompt 上表现好,但 agent 多轮热请求只增几百 token 时,流水线气泡会吃掉收益;负载均衡也未必胜过简单的会话粘性路由——轮间延迟短的工作负载里,保住热 KV 缓存比均衡队列更重要。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →