The Regression Tax: Decomposing Why Skills Help and Hurt LLM Agents
Darshan Tank, Baran Nama
cs.AI
2026-07-25
近 6000 次实验显示,给智能体加技能带来的回归抵消掉 59% 的总增益,好技能赢在回归更少,而非增益更大。
给 LLM 智能体挂「技能」(skill),把某个任务的标准操作流程写进系统提示、让它在遇到同类问题时照着做,已经是常见的提升成功率的手段。主流评估只看平均成功率涨了多少。但这个数字把两件相反的事混在了一起:有些任务本来做不成,加技能后做成了(增益);有些任务本来能做成,加技能后反而做不成了(回归)。一篇只用平均成功率汇报的论文,可能掩盖掉一大块被技能自己砸坏的任务。
作者要回答的问题很具体:这块「回归税」到底有多大、为什么会发生、能不能避免。
核心是一套把通过率变化拆成四类的框架:增益(没技能失败、有技能通过)、回归(没技能通过、有技能失败)、残留失败(两次都失败)、保留(两次都通过)。净效果 = 增益 − 回归。
实验规模是 5832 次任务运行:486 个任务(94 个 OfficeQA-Pro 财政文档问答 + 392 个 SpreadsheetBench 表格操作)× 4 种条件(无技能、Anthropic 技能库、OpenAI 技能库、自研技能库)× 3 套模型-harness 栈(OpenCode+minimax-m2.7、Codex+gpt-5.4-mini、Claude Code+sonnet-4.6)。统计检验用配对数据的精确 McNemar 检验,对 18 次同时比较做了 Bonferroni 校正。
通过逐条对比同一任务在有/无技能下的轨迹,作者把回归归到三种成因。技能描述渗透(skill-description osmosis):技能只是躺在上下文里、从没被调用,行为就变了。接地错位(grounding displacement):技能的流程盖过了智能体对输入的正确理解,选错了表、范围或实体。校验错位(verification displacement):流程压住了智能体本来会对输出做的检查。
回归是实打实的成本。18 个条件下,增益迁移 553 次,回归迁移 324 次,回归抵消掉 59% 的总增益。OfficeQA-Pro 上这个比例更高,66%(122 增益对 81 回归);SpreadsheetBench 是 56%(431 对 243)。
更关键的是「谁赢」的机制。以 OfficeQA-Pro + OpenCode+minimax 为例:
| 技能库 | 通过率 | 增益 | 回归 |
| Anthropic | 51.1% → 52.1% | 14 | 13 |
| OpenAI | 51.1% → 55.3% | 16 | 12 |
| 自研 | 51.1% → 60.6% | 15 | 6 |
三个库的增益数差不太多,自研库能拉开 +9.6 个百分点的优势,主要靠把回归从 12 到 13 压到 6。最好的技能赢在砸坏的更少。
成因分布也讲得通:OfficeQA-Pro 的 81 个回归里,接地错位占 59 个(72.8%),远高于渗透(14 个)。残留失败进一步指向同一处,几乎所有残留失败都「算对了数,但算错了对象」。
还有一个被低估的坑是评分方式。SpreadsheetBench 默认只用最终值评分,跑不了 Excel 结构化引用和新函数,导致「公式正确、引擎算不出来」被判失败。用完整表格引擎重评,九个条件下每个都找回了几十个任务(每个库 42 到 49 个);涉及公式的 663 个失败任务里,226 个(34%)其实是已正确的公式。这部分「回归」是评分系统造出来的,不是技能造出来的。
统计上要诚实:18 个 McNemar 检验里,只有 Claude Code+sonnet-4.6 在 SpreadsheetBench 上的三个库通过了 Bonferroni 校正(p<.001),其余显著但扛不住多重比较。
对做智能体的人来说,结论很可操作。评估技能时必须把增益和回归分开报,只看平均涨幅会高估一个好库、低估一个副作用大的库。与其再堆更多「怎么做」的流程性技能(这是现有技能库的重灾区),不如补强接地和校验这两环,它们才是残留错误的主要来源,而且很多回归靠这两环就能救回来。上自动评测前先把评分器本身做对,价值不低于改技能。
作者自己列了几条:两个 benchmark 都是办公自动化,接地和输出格式是主要瓶颈,结论未必迁到「方法本身是难点」的领域;每套栈把 harness 和原生模型绑在一起,模型效应和 harness 效应没分开;多重检验后只剩三个单元格显著;回归成因是一个作者人工标的,缺交叉标注;技能库也没做等长控制,库与库之间大小和措辞都不同,库与库的对比不是受控的 token 剂量。
样本量也要考虑:OfficeQA-Pro 只有 94 题、SpreadsheetBench 用了 392 题,不算大,即便用配对检验,单个 benchmark 上的百分点差异也要谨慎解读。