规则杂交拆开 agent 自进化的真假:企业任务最高涨 16 点,离天花板仍差 24

GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks

Leijun Zhou, Zhihao Liu, Xiang Qu, Chenxu Liu, Yifei Liu, Yanke Yu, Jingzhe Xu, Xuejun Wu, Buyue Qian, Xi Chen, Yaowei Zheng, Junhao Hu

cs.AI

2026-08-04

这套面向 GDP 业务的企业任务评测用规则杂交让测试涨分可归因;四个 agent 自进化后最高涨 16 个点,但离 91.6% 的理论上限还差 24 个点。

这篇在解决什么

agent 自进化(self-evolution)说的是:agent 把过去几轮任务里学到的东西固化下来(写进记忆、技能或提示),下一次遇到相关任务直接拿来用。这件事的难点不在做,而在评。怎么证明测试任务上的涨分是真的从训练里学来的,不是模型靠世界知识蒙对的,也不是任务本身太简单?

现有的两类评测都不够干净。一类叫 evolution-native,从已有评测集里事后挖训练-测试关系,覆盖的多是简单任务,可挖的关系数量也有限;另一类叫 evolution-adaptive,直接把现成的静态任务集切成两半,因为切分压根没考虑「可迁移能力」,涨分根本没法归因到训练。再加上这些题集都是公开静态的,数据污染(data contamination)随时会让分数失真。GDPevo 要补的就是这三块:面向 GDP 相关的企业任务、从设计上保证涨分可归因、用全自动管线对抗污染。

方法

GDPevo 的核心机制叫规则杂交(rule hybridization),专门用来回答「涨分到底是不是学来的」。做法分三步。先把一个企业场景(比如工单处理:核账户、诊断故障、派单)拆成一堆原子规则,每条都是最小、可独立判定的企业内部约定,比如「某公司的赞助商等级优先级」「另一家的黑名单排除规则」「某张发票的过期日」。这些规则是模型世界知识里没有的,只能从训练任务里推断。第二步,把这些规则打散,每个训练任务只露出一部分;第三步,在 5 个测试任务里把规则重新组合,让某个测试任务同时调用优先级规则和黑名单规则,而这种组合训练任务里从来没出现过。这样只有真正学到了规则、还能组合应用的 agent 才能做对测试题,涨分自然可归因。

评测本身做了几件让数字可信的事。每个任务用确定性的规则判分器打分:LLM 把每个评分点翻译成一段代码测试用例,而不是让 LLM 当裁判,所以每次跑结果一样,每个失分还能追溯到具体哪条规则被违反。成本(token、轮次、钱)和准确率并列报告。生成任务组时还有校准环节:裸做测试题应落在 4060% 分段(太简单或太差都淘汰),fewshot 进化后应再涨 0.10.3,最终分还得低于 0.8 以留出空间;6 个独立审查 agent 投票,至少 5 个同意才收这一组。

agent 的定义是 Harness + Model。测了两个外壳(Codex、Claude Code)配四个模型(GPT-5.5、Opus-4.8、GLM-5.2、DeepSeek-V4-Pro-Preview)。四种监督类型:base(不给训练经验)、fewshot(给训练题+金答案,类比监督微调 SFT)、reflect(给训练题加自己做题的得分反馈,跑 3 轮,类比强化学习 RL)、self(只给训练题、不给任何答案,类比无监督学习)。进化方法统一是基于技能的:把经验蒸馏成一个 SKILL.md 文件再带到测试。基准共 240 个任务、24 个任务组,横跨 CRM、ERP、财务、医疗、法律、数据中心六大域,每组 5 训练 + 5 测试。

结果

Agent(外壳/模型)base 准确率fewshot 准确率涨幅
GPT-5.5 / Codex49.37%64.51%+15.14 pp
Opus-4.8 / Claude Code50.63%67.07%+16.44 pp
GLM-5.2 / Claude Code46.12%60.09%+13.97 pp
DeepSeek-V4-Pro-Preview / Claude Code43.58%48.79%+5.21 pp

fewshot 是最稳的监督类型,所有进化组合都涨过 base,最高 +16.44 pp。但最关键的一组对照是理论上限:把所有隐藏规则连金答案一起喂给模型,让它什么都不用学、直接套规则,准确率是 91.6%。最好的进化配置(Opus fewshot 的 67.07%)离这个上限还差约 24 个点。现有 agent 的自进化能力远远没有兑现。

成本上也有意外发现。GPT-5.5 的 fewshot 既涨了 15.14 个点,又把测试时的成本压低 20.88%。便宜模型加进化能逼近甚至超过贵模型裸跑:DeepSeek-V4-Pro-Preview 的 fewshot 在约 1/28 的成本下做到 48.79%,接近 GPT-5.5 base 的 49.37%;GLM-5.2 的 fewshot 反而超过 GPT-5.5 和 Opus 的 base,分别多 10.72 和 9.46 个点,成本只有一半左右。还有个反直觉结论:起点低不等于进化空间大。DeepSeek base 最低(43.58%),涨幅也最小(+5.21);Opus base 最高(50.63%),涨幅反而最大(+16.44)。

跨域迁移的实验只在 CRM、ERP、财务三个域做(为控制规模)。对角线(同域训练同域测)全部为正。fewshot 和监督微调一样会过拟合源域:6 个非对角格里有 5 个为负,最差 −5.0 pp(在财务上训练、测 ERP)。reflect 更像强化学习,过拟合轻得多,一半非对角格为正,最好 +6.5 pp(ERP 迁到财务),最差也只丢 1.0 pp。

RQ3 问的是「进化的方法(技能生成器)和模型,谁更重要」。固定 agent,只换技能生成器,比了 5 个:作者自己写的一句话提示 Naive,加上 Claude Code、Codex、OpenCode、deepagents 的内置版。结果是 Naive 和那些精心设计的生成器打平甚至更好。进化的幅度主要来自模型本身的智能,不是方法里编码的引导,过度设计反而会拖后腿。

为什么重要

对做 agent 的人来说,这套基准直接给出了「进化到底值不值得做」的硬数据。结论是值得,而且有性价比:便宜模型配 fewshot 技能进化,能在成本远低于大模型裸跑的情况下接近甚至超过大模型 base。更实际的是它给了一个可复用的对抗污染思路,全自动化管线两天就能从 V1 的 120 题扩到 V2 的 240 题,公开题集一旦泄露就重新生成。判分不靠 LLM 裁判、涨分可归因这两点,让分数能拿来当测量工具,而不是一串说不清来源的数字。

也要看清它的位置:这是一篇方法学与基准论文,没有提出新模型,最重的结论其实是「现有 agent 自进化做得还不够好」。对要选型、做评测或判断 agent 能力天花板的人,这是少有的、把企业真任务和可归因测量绑在一起的工作。

局限与存疑

作者自己承认几条。第一,91.6% 的理论上限是近似的:他们没有覆盖法律、医疗、财务所有领域的真人专家,无法测「专家拿到全部规则能做多少分」,只能退而用「喂给模型全部规则」来近似上限。这个数更像「规则全部透明时模型的上限」,不是人类专家上限,也未必是 agent 真能逼近的目标。第二,所有实验只用了一种进化方法(基于技能),虽然作者强调基准本身不挑进化形式,但「模型智能比方法更重要」这个 RQ3 结论是在这一种方法下得到的,外推要谨慎。第三,跨域迁移实验为了可操作只取了三个域、每域一个任务组,样本偏小,−5.0 到 +6.5 这类数字的统计稳定性论文没展开。

另有两处存疑。reflect 在跨域上比 fewshot 稳,但在单域 RQ1 里涨分通常不及 fewshot(论文自己说 fewshot 最稳,Opus 上 fewshot 67.07 高于 reflect-3 的 59.27),这两条结论之间的张力论文没专门解释。另外校准环节(base 必须落在 4060%)是用一个 agent 去筛题的,被筛掉的题在不同模型上表现是否一致、会不会引入隐性偏差,论文没讨论。

术语

原文与代码

相关论文

全部论文解读