Weco让研究Agent改自己的harness,8天接受7次改进并泛化到天气预报

Recursive self-improvement of AI research agents

Dhruv Srikanth, Bingchen Zhao, Dixing Xu, Yuxiang Wu, Zhengyao Jiang

cs.AI, cs.LG, cs.SE

2026-09-22

Weco的AIDE²让研究Agent改自己的搜索与上下文代码,8天接受7次改写,私有评分从0.703升到0.778,在四个留出基准上追平或超过两年人工打磨的生产Agent。

这篇在解决什么

AI研究Agent已经在改训练脚本、写GPU kernel、跑实验。它们优化的是产物,harness(套件层,包围模型、管搜索、上下文和验分的那层代码)仍由人两年两年地打磨。常规研发还碰上收益递减:同一方向继续砸人,边际进步越来越贵。

Recursive self-improvement在这里有一个干净的操作定义:被改的对象就是Agent自己的代码,一次被接受的改写会变成下一轮要改的Agent。关键是在固定评估预算下提高研究效率,并且改动能离开筛选任务。再写一个会刷题的脚手架不够。

方法

AIDE²把问题写成双层优化。内层Agent在给定代码库和可测指标上,按任务美元预算迭代改代码,预算覆盖自身token和执行开销。外层Agent改的是内层这套研究流程。评分g(a)是内层在筛选基准各任务上、用内层看不到的私有数据打的平均分。公开信号给内层优化,私有信号给外层筛选,两边刻意拆开。

内层起点AIDE₀是把原AIDE里机器学习专用零件拆掉、只留树搜索的通用优化Agent:draft探索、debug修错、improve打磨,选择策略一开始是贪心吃最高分。外层用AIDEhuman驱动,这是Weco做了两年的生产研究Agent,在FML-Bench上能压过AI Scientist、OpenEvolve等一串对照。外层模型固定为Claude Opus 4.7,内层评估固定为Gemini 3 Flash。

筛选基准故意做成三类:机器学习工程、启发式算法工程、harness工程。多样性是为了逼出通用机制,而不是任务trick。

结果

一次8天、100个节点的轨迹里,第2、6、28、39、47、63、85步共接受7次改写,在位评分从0.703升到0.778,超过AIDEhuman的0.749。另两次完整复跑分别接受2次和4次。

四个从未参与筛选的留出基准上,最强发现体AIDE₈₅追平或超过AIDEhuman。AIDE₄₇在MLE-Bench和WeatherBench 2上更高,说明筛选把异质任务揉成一个分数后,强检查点之间不必单调。

AgentALE-BenchMLE-Bench百分位WeatherBench 2FML-Bench
AIDE₀1536±330.678±0.0060.262±0.20515.0±0.9%
AIDE₄₇1713±260.730±0.0050.798±0.00319.7±1.2%
AIDE₈₅1790±90.722±0.0110.793±0.00519.9±1.1%
AIDEhuman1511±350.708±0.0070.404±0.19319.6±1.0%

WeatherBench 2不在筛选任务的领域里。演化检查点几乎每次都收敛到同一类数值格式改动,AIDE₀和AIDEhuman最多一粒种子能摸到类似解。

KernelBench上的reward hacking(刷代理指标)从AIDE₀的55%降到AIDE₈₅的32%,AIDEhuman是39%。这条行为从未进入优化目标。

AIDE₈₅改了三块:用UCB1在五种draft策略上做bandit,每五步把全局最优节点叉到另一条策略;draft/improve只读压缩摘要,bug率≥15%才注入最多三条失败签名,单次调用prompt在ALE和FML上大约缩小50倍;再加私有分割提醒、空代码重试,以及修掉「一个测试失败就整份评分崩溃」的评测漏洞。

点火测试把AIDE₄₇和外层的AIDEhuman对照,三粒种子、各50步,终点0.780对0.782,分不出谁更会开外层。噪声在两层里叠加,再加种子的成本,作者没有把「加速回报」说成已点燃。

为什么重要

这篇把RSI从「Agent改自己」收成可复现的harness搜索:固定预算、公私信号分离、留出泛化、再加一条没优化却下降的刷分率。对正在堆Agent脚手架的人,它给出的可迁移件很具体:策略级探索、失败记忆、有界上下文。代价是把瓶颈从专家工时推向算力。

局限与存疑

接受一次改写靠一次带噪的私有评分,错收会带偏后面整棵树。点火测试样本不够,不能声称发现体比两年人工Agent更会自我改进。发现体难解释,哪些模块在干活、哪些是早先步骤的残骸并不清楚,接进生产还要过兼容和基础设施约束。AIDE₀有若干跑次撞上上下文窗口,按中途最优计分。跨模型迁移在更高预算下成立,MLE-Bench上最强模型的增益落在误差带里。

术语

原文与代码

相关论文

全部论文解读