vLLM 智能体优化细节:packed KV 省 10% 显存,Kimi K3 解码吞吐提升 2.7 倍
vllm_project · x · 2026-09-09
vLLM 智能体服务优化系列推文的第 4-6 部分,补充三项核心发现:
- KV cache 管理:为 DeepSeek V4 采用 packed KV 布局,节省约 10% KV 显存,每 block 的 92 个张量精简为 1 个。
- 并行策略跟随模型:Decode context parallelism 让 Kimi K3 在相同 TPOT 下解码吞吐达 2.7 倍;prefill context parallelism 使 DeepSeek V4 的稀疏 MLA 比 head sharding 快 2.65 倍。
- 简单调度也有效:仅限制 prefill 即可打破队头阻塞,TPGS 提升 93%,p90 交互性改善约 2.3 倍。
智能体流量画像:会话中位 43 轮,输入中位 142K token、输出仅 444 token,前缀缓存命中率超 96%,44% 会话派生子 agent。
所属事件:vLLM 发布 AgentX 实测:真实 Agent 负载优化带来最多 106 倍成本优势(5 条相关)→
「编程与Agent」频道最新
- Mitchell Hashimoto 演示远程持久会话工具 Superlogical:可完全替代 SSH — iannuttall · 2026-09-09
- LLM 排版总溢出?工程师用测量-修复回路驯服单页生成 — Scholeristical · 2026-09-09
- OpenClaw 2.0 后恢复高频发版,新版本支持浏览器自动化实况观看 — heyneighbor · 2026-09-09
- Astra 花约 6 小时把《大乱斗 Melee》编译到 macOS,120 FPS 运行 — banteg · 2026-09-09
- FreeBots World 上线:可铸造 AI bot 让它在你领地上实时建造 — Daniel_Farinax · 2026-09-09
- 用户用对话式 AI 引擎 Spawn 做出首部日式漂移赛车游戏 — majidmanzarpour · 2026-09-09