vLLM 发布 AgentX 智能体服务优化:吞吐达 Opus 5 方案的 106 倍成本优势
vllm_project · x · 2026-09-09
vLLM 联合 SemiAnalysis 的公开智能体基准 AgentX 发布长文,系统讲解针对真实智能体负载的全栈推理优化。
智能体流量画像(来自真实编码 agent 轨迹):会话中位数 43 轮;输入中位数 142K token,输出仅 444 token;前缀缓存命中率超 96%;44% 的会话会派生子 agent——长前缀、短输出、高频复用。
关键优化成果:
- KV cache:为 DeepSeek V4 设计的 packed KV 布局节省约 10% KV 显存,并将每 block 的 92 个张量合并为 1 个。
- 并行策略跟随模型结构:Decode context parallelism 让 Kimi K3 在相同 TPOT 下解码吞吐提升 2.7 倍;prefill context parallelism 让 DeepSeek V4 的稀疏 MLA 比头分片快 2.65 倍。
- 调度:仅通过限制 prefill 打破队头阻塞,TPGS 提升 93%,p90 交互性改善约 2.3 倍。
- 经验教训:pipeline parallelism 适合冷长 prompt,warm agent 轮次中气泡会吃掉收益;短间隔负载下保持 warm KV cache 的会话粘性路由可能优于负载均衡。
成本对比:DeepSeek V4 Pro 在 p90 每用户 50+ tok/s 的严格 SLO 下维持 83K tokens/GPU-秒,峰值达 130K;同等负载与缓存命中率下,用 Opus 5 服务成本高出 106 倍——说明开源权重模型在针对性调优的推理栈上有巨大空间。
所属事件:vLLM 发布 AgentX 实测:真实 Agent 负载优化带来最多 106 倍成本优势(5 条相关)→
「编程与Agent」频道最新
- Anthropic 用 Claude Tag 当 CI/CD 故障值班一线响应 — ClaudeDevs · 2026-09-09
- 详解 Anthropic 的 Claude 值班agent:3分钟定位CI故障 — ClaudeDevs · 2026-09-09
- altryne 发现 agent 项目藏着 soul.md,致敬 Steinberger 的影响力 — altryne · 2026-09-09
- Mitchell Hashimoto 演示远程持久会话工具 Superlogical:可完全替代 SSH — iannuttall · 2026-09-09
- LLM 排版总溢出?工程师用测量-修复回路驯服单页生成 — Scholeristical · 2026-09-09
- OpenClaw 2.0 后恢复高频发版,新版本支持浏览器自动化实况观看 — heyneighbor · 2026-09-09