vLLM 硬核复盘:管线并行遇热缓存失效,Kimi K3 解码吞吐 2.7 倍
vllm_project · x · 2026-09-09
vLLM 项目分享推理服务栈的三层工程经验:
KV 缓存管理:为 DeepSeek V4 采用紧凑 KV 布局,节省约 10% KV 内存,并把每 block 的 92 个张量压缩到 1 个。
并行策略要跟着模型注意力结构走:解码上下文并行在 Kimi K3 上以相同 TPOT 拿到 2.7 倍解码吞吐;预填上下文并行让 DeepSeek V4 的稀疏 MLA 快 2.65 倍;但同一策略在 DeepSeek V4 上仅与 DEP 持平。
调度经验:管线并行在冷长 prompt 上表现好,但 agent 多轮热请求只增几百 token 时,流水线气泡会吃掉收益;负载均衡也未必胜过简单的会话粘性路由——轮间延迟短的工作负载里,保住热 KV 缓存比均衡队列更重要。
「Infra」频道最新
- Magic 官宣预训练配方效率提升逾 10 倍,剑指万亿参数与自动化 AI 研发 — Dr_Singularity · 2026-09-09
- Magic 称新预训练配方计算效率提升 10 倍以上,50 倍 FLOPs 匹敌 DeepSeek — Dr_Singularity · 2026-09-09
- Alexandr Wang:Muse 丝滑全靠大规模自有算力可补贴 — alexandr_wang · 2026-09-09
- Epoch AI:GPT 与 Claude 长上下文定价差异或暴露架构不同 — scaling01 · 2026-09-09
- 百吉瓦算力什么样?一年需 876 太瓦时电、国家级电力系统 — shyamalanadkat · 2026-09-09
- vLLM 发布 AgentX 基准实测,全栈优化真实 Agent 推理服务 — vllm_project · 2026-09-09