正则化约束Agent外壳自进化,OOD最高涨4.7分、token比无约束少36%

RRSI: Regularized Recursive Self-Improvement of Agent Harnesses

Peng Xia, Rujun Han, Zifeng Wang, Yanfei Chen, Yufan Zhang, Yoonho Lee, Chengsong Huang, Han Yu, Zhongying CuiZhu, Yifei Ming, Huaxiu Yao, Burak Gokturk, Tomas Pfister, Chen-Yu Lee

cs.LG, cs.AI, cs.CL

2026-09-22

Google Cloud的RRSI给Agent外壳自进化加上提案预算退火、泄漏筛查和成本门槛。八个基准上进化集最高加14.1分,五个OOD基准最高加4.7分,token比无正则进化少约36%。

这篇在解决什么

现在的LLM agent大半能力在外壳(harness)上:系统提示、控制流、工具描述、记忆、上下文裁剪。权重冻结,改外壳就能换表现。最近一批工作让模型自己根据失败轨迹改外壳,等于在系统层做递归自改进(RSI)。

麻烦也跟着来。进化回路反复在同一批evolve任务上提案、打分、留下赢家,很容易把任务名、标准答案、评测噪声写进提示。进化集分数涨一截,换套工具或换个verifier就吐回去,有的方法OOD上甚至掉到初始外壳H0以下。

方法

RRSI不缩小可改的组件集合,提示、控制流、工具、记忆、子agent全都能动。它管的是搜索怎么走。

提案侧三条:

选择侧四条,缺一不可:

骨干全程冻结。主实验用Claude Opus 4.8当policy、提案器和泄漏critic。编码域从Terminus-2出发,办公和工程设计用ReAct加MCP工具网关和ReSum式上下文管理。

结果

三个域各自只在一套任务上进化,外壳原样拿到held-out和OOD基准。

进化集:Terminal-Bench 2.1加6.0分,EngDesign加4.9,Harvey LAB加1.1。Gemini 3.5 Flash在Terminal-Bench上从64.6到78.7,这就是摘要里「最高14.1分」的来源。

OOD侧:SWE-bench Verified加1.8分,仓库级修bug从未进过打分;Harvey LAB的ID held-out加2.3;JobBench、GDPval、APEX-Agents分别加4.7、3.5、3.7,相对涨幅7.2%到13.1%;Frontier-Eng加4.3 Medal分,相对24.3%。没有任何held-out回退。

办公域和四个进化方法同H0、同预算比:

方法Harvey进化集JobBenchGDPvalAPEX-AgentsOOD均分
H089.436.048.834.239.7
Meta-Harness93.037.149.135.740.6
TTHE91.135.247.031.738.0
无正则进化92.8未单列未单列未单列40.3
RRSI90.540.752.337.943.6

RRSI进化集涨得最少,OOD均分唯一比H0高出一分以上。消融两边都拆掉,进化集冲到92.8,OOD只剩40.3,每trial token从2.42M涨到3.80M。只拆接受规则,进化集91.5、OOD 41.0、token 3.59M。只拆提案规则,OOD掉1.7分。

编码域换Gemini 3.5 Flash再进化,SWE-bench仍加2.2分。把这套外壳原样交给从未参与搜索的Gemini 3.1 Flash Lite,Terminal-Bench从11.2到14.6。外壳是程序,不完全绑死在搜索用的backbone上。

为什么重要

做agent产品的人多半已经在手改harness。这篇把「改外壳会过拟合评测」写成可测的evolve-to-transfer gap,并给出一组不改搜索空间、只改搜索动力学的约束。想自动进化外壳,优先抄泄漏筛查和成本门槛:前者挡住写答案进提示,后者挡住靠堆上下文刷分。

工程设计任务用冻结仿真器打分,不是LLM judge,增益还在,说明不是在迎合judge文风。

局限与存疑

只进化外壳,不更新权重。仍依赖有限evolve集和一串超参,反馈质量差时正则也救不了。跨架构、跨工具生态、更长的自改进过程还没测。办公域OOD三个基准里仍有judge打分,尽管工程设计侧补了一刀确定性评测。β0、β1在进化集上选定后冻结,换域是否要重标定,论文没做系统扫描。

主实验policy是Claude Opus 4.8,提案器也是它。换Gemini能转,但不等于任意小模型都能当提案器。泄漏critic本身是LLM,漏检或误杀都会塑造搜索方向,论文没有单独报critic的精确率。

术语

原文与代码

相关论文

全部论文解读