vLLM 发布 AgentX 实测:真实 Agent 负载优化带来最多 106 倍成本优势
vLLM 项目联合 SemiAnalysis(另一帖提及 Inferact)基于公开 agentic 基准 AgentX 发布长文「vLLM x AgentX: Optimizing for Real-World Agentic Serving」,系统讲解针对真实 Agent 工作负载的全栈推理优化。团队给出的结论是:相比基于 Opus 5 API 的方案,优化后的 vLLM 服务吞吐成本优势最高可达 106 倍。
已确认
- 流量画像来自真实编码 Agent 追踪数据:会话中位数 43 轮,中位输入 142K token,而输出仅 444 token,前缀缓存命中率超过 96%,44% 的会话会 fork 子 agent
- KV cache 管理优化:为 DeepSeek V4 采用 packed KV 布局,节省约 10% KV 显存,每 block 的 92 个张量精简为 1 个
- Kimi K3 解码吞吐提升 2.7 倍
- 服务成本较 Opus 5 API 方案最多低 106 倍
- 官方指出 Agent 流量已成为 vLLM 的主要流量来源,多轮会话、长上下文与大量前缀复用对 KV cache 管理和调度提出了新要求
为什么重要
Agent 负载「输入长、输出短、前缀高度复用、多轮 fork」的特征与传统聊天/补全负载差异显著,直接影响推理引擎的 KV cache 设计与调度策略。vLLM 将优化成果基于公开基准 AgentX 实测发布,为社区提供了可复现的参考,也强化了其作为 Agent 时代推理服务首选栈的定位。
2026-09-09 ~ 2026-09-09 · 5 条相关
一手来源
- vLLM 发布 AgentX 基准实测,全栈优化真实 Agent 推理服务 — vllm_project ·
- vLLM 实测:Agent 会话中位 43 轮,输入 142K 输出仅 444 token — vllm_project ·
- vLLM 发布 AgentX 智能体服务优化:吞吐达 Opus 5 方案的 106 倍成本优势 — vllm_project ·
- 【源头】vLLM 发布 AgentX 基准实测,全栈优化真实 Agent 推理服务 — vllm_project · 2026-09-09
- 【源头】vLLM 发布 AgentX 智能体服务优化:吞吐达 Opus 5 方案的 106 倍成本优势 — vllm_project · 2026-09-09
- 【源头】vLLM 实测:Agent 会话中位 43 轮,输入 142K 输出仅 444 token — vllm_project · 2026-09-09
- vLLM 智能体优化细节:packed KV 省 10% 显存,Kimi K3 解码吞吐提升 2.7 倍 — vllm_project · 2026-09-09
- vLLM发布AgentX实测:服务成本较Opus 5 API低最多106倍 — vllm_project · 2026-09-09