Rehearse: Stepping Back from the Confidence Cliff in Self-Improving Autoresearch
Jiazhen Ji, Shouhong Ding
cs.AI
2026-07-30
自动研究循环后期,LLM 评判的选择性准确率从 82.8% 跌到 56.9% 却仍照常拍板;Rehearse 加聚焦记忆拉回 83.5%,4000 次训练预算下三个任务终点都更好。
「自动研究循环」(autoresearch loop)是当下很火的一类 ML agent:让它自动改训练代码,每改一处就跑一次完整训练,涨点就留下,不涨就回滚。AutoSOTA、AIDE 这类系统都是这个路子。
作者先从公开的 AutoSOTA 运行日志里挖出一个规律:有用的改动占比从迭代前两次的 70%,掉到第 6 次以后的 43%;就连那些确实涨点的改动,平均增益也从 3.6% 缩到 0.3%。后期绝大多数实验跑完就被回滚,算力大多花在试错上。
但更关键的发现是 agent 越往后越判不准。它得在花掉一次训练之前,判断这个改动值不值得跑。这个「跑之前的判断」能力会随成功数累积而衰退,而 agent 自己并没有意识到,它照样很自信地拍板。作者管这叫 confidence cliff(自信崩塌)。
Rehearse 把原本「出一个主意就跑」的循环,改成 Propose–Predict–Execute(提多个方案、预测、执行):
几个反直觉的设计选择值得单独说。聚焦检索(只召回相似尝试)而不是堆全历史,把悬崖区的选择性准确率从 70.8% 顶到 83.5%。作者的原话大意是给一堆乱堆加结构也救不回来,指望评判者自己从一整条 trace 里淘金不行,得先替它筛掉无关历史。
只记成败、不记失败原因。加上失败原因反而把准确率从 83.5% 拉到 80.6%,原因是这些「为什么失败」大多是噪声。strict consensus(正反各判一次)把 run-to-run 的波动从 5.1 个点压到 1.7 个点。这里有个朴素动机:浪费的是执行本身,所以记忆必须在跑之前读。
先看单轮基准(39 个源自论文的 AutoSOTA 任务,共 366 个配对,其中 nbaseline≥3 的是「悬崖区」):
| 记忆配置 | 总体选择性准确率 | 悬崖覆盖 | 悬崖选择性准确率 |
| 无记忆 | 77.6 | 85 | 56.9 |
| 全历史堆 | 82.0 | 80 | 70.8 |
| 自反思缓冲 | 81.0 | 90 | 74.1 |
| LLM 历史摘要 | 81.9 | 78 | 80.9 |
| Rehearse(聚焦检索) | 82.3 | 77 | 83.5 |
Rehearse 的总体准确率只比基线略高(82.3 vs 77.6),真正的差距在悬崖区:无记忆判到 56.9% 还照常拍板,Rehearse 选择少判(覆盖 77)、判得更准(83.5)。
再看真实多轮(共 4000 次预算训练,五粒种子均值):
| 任务 | 指标 | Vanilla | Rehearse |
| nanochat | valbpb 降低 | 7.1% | 10.7% |
| CIFAR-10 | 准确率提升 | 2.10% | 2.85% |
| ETTh1 | MSE 降低 | 40.1% | 54.0% |
nanochat 上,光加「提多个加选一个」不带记忆,就把终点从 7.1% 抬到 8.4%,记忆再加一笔到 10.7%。第 30 次实验时 Rehearse 已到 8.9%,vanilla 才 3.3%。ETTh1 的种子间方差从 ±11.2 降到 ±3.0,稳得多。Rehearse 在 54 次(CIFAR)、63 次(ETTh1)实验就达到 vanilla 100 次的终点,省了约 46%、37% 的训练。额外 10 次跨循环跑里它赢了 9 次。
对在跑 ML agent 循环的人(AutoSOTA、AIDE 这类)来说,这篇文章把后期瓶颈讲清楚了:不是点子不够,是 agent 还在自信地烧钱试错。Rehearse 给的是一个轻量、可上线的 skill,不改训练、不换模型,只在循环里插一层「跑前先比一比加记相似先例」。代价是多花一些 proposal 和评判推理(这部分没算进他们的预算),而且它只能从 proposer 给出的候选里挑。
论文自陈三条:五粒种子、三个有可测终点的循环,novelty 或论文打分系统、更大规模种子研究不在范围内;只从 proposer 候选里选,别的记忆形式和候选数没在线测;预算只数训练运行,不含 proposal 和评判推理,真实成本比标题更高。
读下来还有一处存疑:悬崖基准里的 nbaseline 是观测得到的、不是随机因果,后期决策可能在 headroom、改动族、难度上都不一样,所以它只是「按运行深度」的受控代理,不是因果估计。另外评判用的是固定模型(deepseek-v4-pro),换别的评判者能否迁移,论文没测。