完成率没掉但工具调用翻了三倍:上下文压缩的隐性成本

What Does Context Compression Cost an Agent? Interaction Costs Unrevealed by Task-Completion Metrics

Shuyu Liu

cs.AI

2026-08-17

在 24 轮有界 agent 环境里做受控测量:5× 滑窗压缩下 GPT-5.5 完成率 80%→85%(不显著)而检索调用 21.0→63.9(p=.002),六组比较检索全部上升,完成率对这笔账是盲的。

这篇在解决什么

上下文压缩(context compression)是长程 agent 的标配:轨迹太长,把早期内容摘要或滑窗丢掉。评估压缩方法的通行做法是看任务完成率有没有掉。这篇指出这个指标不完整:压缩丢掉的状态如果执行时还要用,agent 只能靠额外的工具调用把它重新查回来,任务照样完成,但交互成本悄悄涨了。完成率看不见这笔账。

这不是假想。作者给出了一个可复现的测量协议,并在三种模型上把「完成率不变、交互成本翻三倍」这件事做成了实验事实。

方法

环境是 IRBench,一个确定性项目规划任务:10 个任务、容量为 1 的资源、只有在交互中才会揭示的隐藏约束(顺序规则、资源占用、失败次数上限)。固定 24 轮交互预算,每轮一次模型调用加工具结果,完成率 = 预算耗尽时完成任务的比例。四个工具里,queryresource、checkdependency、gettaskinfo 算检索调用(重新获取外部状态),execute 算执行调用。

压缩算子两档:滑窗(直接丢早期轨迹,预算为轨迹的 1/r,r 取 1.7×、2.5×、5×、10×)和抽取式摘要(同样预算,但丢掉的轮次换成已观测状态事实的确定性摘要)。两者 token 预算相同,差别只在「丢的内容还查得回来吗」,这是一个干净的对照。

再往里,用 oracle 干预把特定被丢状态作为尾注注回上下文:D 态(外部可查:任务图、前置条件、资源占用)和 R 态(历史依赖:运行中揭示的约束、失败计数)。三种模型(DeepSeek deepseek-v4-flash、Qwen qwen3.7-plus、GPT-5.5)× 两种任务区制(高 IR:约束只在执行中揭示,丢了代价大;低 IR:状态可从公开任务图重新推导)。

结果

六个模型-区制组合里,检索调用全部上升,且几乎贡献了全部新增交互;经 Holm 校正后六组中五组显著。执行调用基本不变。

设置完成率检索调用
GPT-5.5 高 IR,Full80%21.0
GPT-5.5 高 IR,5× 滑窗85%(p=1.0,不显著)63.9(p=.002)
DeepSeek 高 IR,Full83%22.2
DeepSeek 高 IR,5× 滑窗72%55.1
DeepSeek 高 IR,10× 滑窗66%(p=.016)63.2
同上,改用抽取式摘要 5×83%19.5

GPT-5.5 是最干净的例子:完成率统计上没动,检索调用翻了三倍。DeepSeek 要压到 10× 完成率才显著掉,而检索在 5× 就已经涨了,检索是更早响应的信号。摘要算子在同等预算下把完成率保在 83%、检索压回 19.5,说明代价来自「丢了还需要的执行相关状态」,不是压缩本身。

保留干预的结果更有意思。随机选事实保留,效果追平离线事后 oracle(差 0.1 次调用);但把保留的 D 态换成语义无关的编造内容,检索暴涨 57%(p<.001),完成率却统计不变。保留内容是行为承重的,但挑哪些真事实的边际价值很低。换到 ALFWorld 环境,同样的滑窗压缩不产生任何检索激增(完成率 10.0% 对 8.9%),因为那里相关状态可以直接重新观测。

为什么重要

对做长程 agent 系统的人,这篇改变了一个评估习惯:压缩方法的 A/B 不能只看完成率,要把工具调用数记下来。检索成本先于完成率响应,意味着它是更灵敏的回归指标,能在完成率崩掉之前发现压缩配置有问题。实操结论也直接:保留可重查状态摘要的算子比裸滑窗划算;摘要里别塞无关内容,塞了不只浪费 token,还会诱发更多的防御性重查。作者把「完成率不是交互成本的充分统计量」表述成一个不可辨识性(non-identifiability)结果,这个提法对评估方法论本身有参考价值。

局限与存疑

作者列了 11 条,拣重的:只有两个有界、偏合成的环境,具体成本量级未必能外推;只有三个模型家族,跨模型比较是描述性的;24 轮预算是设计选择,换预算可能改变成本向失败的转化点;工具调用数只是成本的代理,不是真实延迟或美元成本;检索/执行的划分是工具层面的,不代表语义意图。还有一个由 ALFWorld 结果引出的边界:检索激增是环境依赖的,不是上下文变短的内在后果,别把结论背到所有场景。单作者论文,六个模型-区制里有一个(低 IR 下某一组)未过校正,边缘结论慎引。

术语

原文与代码

社区讨论

相关论文

全部论文解读