From LLM Inference to Agentic Workloads: Characterization and Implications for Serving Systems
Chaokun Chang, Yukun Zhou, Kaihua Fu, Dakai An, Tianyu Feng, Hanfeng Lu, Sheng Yao, Pu Guo, Yinghao Yu, Yizhou Shan, Bo Li, Binhang Yuan, Wei Wang
cs.OS, cs.AI, cs.DC, cs.MA
2026-08-15
港科大联合阿里、字节用 AgentSysBench 测十类 Agent 与 17.9 万条生产会话:五个应用延迟由工具主导,沙箱峰值 28GB;任务感知调度降延迟 29–40%,状态卸载省内存 4.6 倍。
Agent 服务系统还在沿用 chatbot 那套假设:延迟在 GPU 上,一次请求一次推理,优化对象是 token。SWE-bench、WebArena 这类能力基准只看任务成不成,不记工具耗时、会话状态体积、跨用户复用。现有 serving 论文又常只拿一到三个应用、固定一套栈,测到的瓶颈到底来自工作负载还是部署选择,分不清。
港科大联合阿里、字节做了一套系统向基准 AgentSysBench,覆盖十类应用,再配一天 178,799 条生产会话。要回答的问题很具体:Agent 请求里时间、内存和钱到底花在哪,以及这些现象能不能转化成可落地的调度和缓存改动。
AgentSysBench 把工作负载写成四元组:请求分布、工具环境、模型、编排结构;把服务系统写成硬件、组件机制、部署拓扑。十个应用按这个空间选,不按领域凑名单。RAG 走固定流水线,DeepResearch 带规划与并行检索,Mini-SWE、Codex、Claude Code 走 ReAct 循环,WebAgent 和 GUIAgent 分别接浏览器和桌面沙箱,HuggingGPT 调度专用模型,Openclaw 和 Pi-AutoR 覆盖办公与科研长任务。
受控实验在统一 Docker 栈上跑:白盒应用插桩,黑盒应用走 LLM/工具代理和沙箱 hook,记录到单次 LLM 调用、工具调用和状态操作。生产侧补三套 24 小时 trace:编程 Agent 35,037 会话、搜索问答 141,376 会话、类 Openclaw 办公 Agent 2,386 会话。受控侧合计 4,641 条请求、64,924 次 LLM 调用、118,274 次工具调用。
十个应用里五个,工具和环境已经主导或并列主导端到端延迟。GUIAgent 的桌面沙箱超过 70%,Pi-AutoR 的实验运行时占 90%。请求跨度从秒级到数小时:Mini-SWE 常超过十分钟,Pi-AutoR 能跑到几小时。沙箱工作集中位峰值约 0.8GB,单会话峰值 28GB;Claude Code 配 DeepSeek-V4 时 KV cache 可到 11GB GPU 内存。同一组件上任务差一个数量级:DeepResearch 的 Embed-Doc 比 Embed-Query 慢 32 倍;同一条 Mini-SWE 轨迹里,同一次 LLM 任务延迟差到 30 倍,沙箱里 pip install 比 sed 慢 171 倍。
瓶颈还会跟着请求类型、模型档位和部署走。Claude Code 在 MCP-Atlas 六类任务上,Movie/BI/DB 的 LLM 占比可到 90%,ETL/Wiki/MAP 的工具占比可到 84%。DeepResearch 把 writer/summarizer 从 DeepSeek-V4-Flash(51 token/s)换成 V4-Pro(21 token/s)后,总时间从 10.0 小时涨到 14.0 小时,瓶颈从 embedding 换成 LLM。GUIAgent 把 SGLang batch size 从 1 调到 4,TPOT 从 7ms 升到 30ms,LLM 就从配角变成瓶颈。
生产侧更刺眼。编程 Agent 中位会话只有 20% 的生命周期在真正执行,70% 的会话执行占比不到一半。空闲多落在 1–10 分钟,长的能过夜,沙箱却一直占着。上下文开头系统提示占 99.7%,后期历史(主要是工具观察)涨到 84.3%;模型一步只吐 151 个 token,却要先吃 166,721 的上下文。3,170 次 compaction 里 99% 能把上下文压掉七成以上,但一次平均吃 176K 输入、吐 5K 输出,平均耗时 156 秒,p99 到 775 秒。KV cache TTL 只有 5 分钟,对不上人的节奏,59.4% 的会话至少被踢过一次,重预填充贡献了 31.5% 的估计费用(按 Claude Opus 4.6 标价)。搜索侧 373,678 次查询里,27% 的独特查询贡献了 67.3% 的调用。
四组对照把观察变成可执行的数字:
| 改动 | 对照 | 结果 |
| 任务拆分服务(Dynamic RAG) | 同 GPU 数、组件共享 | 延迟降 29–40% |
| embedding 与向量库同机 | 各占一台 | 高负载延迟降到 1/4.5,网络占比从 67.5% 降到可忽略 |
| 沙箱空闲卸载(Mini-SWE) | 全程占着内存 | 平均内存降 4.6 倍,峰值 2.1 倍,延迟涨不到 0.5% |
| 搜索结果 10 分钟缓存 | 无缓存 | 少 35.2% 重复搜索,聚合搜索时延省 19.3% |
URL 缓存 10 分钟 TTL 还能少 11.65% 的重复抓取、省 16.5% 聚合抓取时延。
给做 Agent 平台的人,这篇把「优化推理就够了」这条路堵死了。一半应用的关键路径在沙箱、检索、浏览器,继续抠 TPOT 碰不到总时间。生产会话大量时间在等人确认或下一条指令,却占着沙箱和 KV cache;5 分钟 TTL 和 1–10 分钟空闲对不上,钱花在重预填充上。搜索查询跨用户高度重复,单会话优化看不见这块。
能立刻用的是偏脏活:查询级缓存、embedding 和向量库同机、把短 query 和长文档 embedding 拆队列。任务感知调度和状态卸载是方向,论文给的是概念验证,不是现成系统。
这是一篇测量论文。价值在把瓶颈画清楚,不在交出新引擎。
受控实验默认「一卡一工作流、容器走共享内存虚拟网」,和多租户混部差一截。生产 trace 来自三套内部部署,编程 Agent 的 compaction 和 5 分钟 TTL 是该 harness 的选择,换官方 Claude Code 栈或自建 ReAct 循环,数字会漂。成本按公有云标价和 Claude Opus 4.6 价目估算,Pi-AutoR 沙箱费用超 99% 依赖 E2B 一类按秒计费,自建机器这笔账对不上。状态卸载测的是 LLM 规划期间的沙箱空闲,不是生产里那种分钟到小时的等人间隔。四组优化各自独立,没有叠在同一套系统上报告端到端收益。AgentSysBench 声称将开源,论文本身没有附仓库。