vLLM 发布 AgentX 智能体服务优化:吞吐达 Opus 5 方案的 106 倍成本优势

vllm_project · x · 2026-09-09

vLLM 联合 SemiAnalysis 的公开智能体基准 AgentX 发布长文,系统讲解针对真实智能体负载的全栈推理优化。

智能体流量画像(来自真实编码 agent 轨迹):会话中位数 43 轮;输入中位数 142K token,输出仅 444 token;前缀缓存命中率超 96%;44% 的会话会派生子 agent——长前缀、短输出、高频复用。

关键优化成果:

成本对比:DeepSeek V4 Pro 在 p90 每用户 50+ tok/s 的严格 SLO 下维持 83K tokens/GPU-秒,峰值达 130K;同等负载与缓存命中率下,用 Opus 5 服务成本高出 106 倍——说明开源权重模型在针对性调优的推理栈上有巨大空间。

所属事件:vLLM 发布 AgentX 实测:真实 Agent 负载优化带来最多 106 倍成本优势(5 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →