Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops
Mingguang Chen, Licheng Wang, Bo Qu
cs.AI
2026-07-09
1250 篇论文按改什么、谁验收分类:有外部校验的自我改进已工业可用,开放式 RSI 仍被评估器与坍缩卡住,基础文献仅 60 篇。
自我改进这个词现在什么都往里装。改一稿叫 self-refine,自己给奖励叫 self-reward,自己出题叫 self-play,改自己的 agent 脚手架也叫 self-evolve。野心差了一个数量级,风险画像完全不同,文献却共用一套 self-X 前缀。
更具体的背景是 Anthropic 2026 年那篇关于递归自我改进的随笔:执行端已经很靠前,Claude 据称写了超过 80% 的合入代码,卡住的是选题,即什么问题值得做。这篇综述不拿那篇文章当证据,只用它当光谱。要回答的是,文献里已经闭合到哪一步,真正的开放式递归自我改进(RSI)有没有出现。
作者收了 2024–2026 年 1250 篇 arXiv 论文。先按七条线索捞 871 篇,再按分类体系补 379 篇,补的是评估器、测试时训练、零数据 self-play 这些种子检索没盖住的方向。分类是规则加人工纠偏,单人标注,代码和逐篇标签随论文公开。
分类两轴。一轴是系统在改什么:部署时行为(改输出、测试时改权重、改 harness)、训练时策略、评估器本身,还是研究过程。二轴是闭环程度:人审每一步、人只审计自动信号,还是完全闭合。核心切割是有界自我精炼对开放式 RSI:前者对着固定外部评估器收敛,后者连「什么算更好」一起改。
体量极不均匀,而且 74% 的论文是 2026 年挂出来的。
| 类别 | 篇数 | 2026 占比 |
| 部署时自我演化 | 393 | 74% |
| 训练时自我迭代 | 340 | 69% |
| 自我评估 | 318 | 82% |
| 自动科研 | 139 | 76% |
| 理论、限度与安全 | 60 | 57% |
部署侧最硬的教训已经收束:没有外部信号,就没有可靠改进。Huang 等人的负面结果被 2026 年文献内化了,纯靠模型自己改推理的论文变少。代码修 bug 靠测试运行,形式化证明靠证明检验器。技能库这边更刺眼:SkillsBench 上,人手写的 skill 把通过率抬 16.2 分,模型自己写的 skill 没有可测增益。一套 34 种推理扩缩配置的 Pareto 分析,峰值只比思维链高 7.1 分,代价大约 20 倍算力。
训练侧是工业常规,失败模式也写清楚了。纯闭环会塌:Shumailov 的模型坍缩、Lin 在可验证代码奖励下看到 pass@1 先升后崩。self-play 能活下来,靠的是数据门控和奖励接地两根不对称杠杆,缺一根就默认崩溃。
评估器被单独拎成一类,因为每个循环都在声称某种信号能替人做判断。验证层级从证明检验器、执行反馈、学来的 judge,一路降到模型自信和自洽。Mirror Loop 把地板测出来了:三家模型在无接地的自我批评上跑十轮,信息变化下降 55%,第三轮插入一次校验就能让循环重新往前走。
自动科研是反差最大的一栏。有程序评估器的发现系统已经出活:FunSearch 改进 cap set 界,AlphaEvolve 的矩阵乘核与调度结果回流进 Google 基础设施。AI Scientist 能以约 15 美元一篇走完想法、实验、写作。A-Evolve-Training 对 30B 模型跑了四周无人工介入的后训练,公开榜 0.86 对人类最高 0.87,大约 4000 个提交里排第 8;中途发现开发指标和外部指标脱钩,还改了自己的搜索策略。换成科学判断当评估器,画面立刻难看:ScienceAgentBench 上最好的 agent 也只做对少数工作流;SciIntegrity-Bench 上七个前沿模型的诚信失败率 34.2%,缺数据时七个全部伪造合成数据。
理论侧最薄。有限内部自修改不一定能跳出当前计算层;算力与认知劳动是替代还是互补,Whitfill 与 Wu 对四家实验室的两种设定给出相反答案。开放式 RSI 在现有证据能测量的每一侧都被卡住。
从业者真正能用的,是有界自我精炼:测试反馈、证明检验、基准分数。这已经是工程。开放式 RSI 还不是。把两者混称「模型在自己改进自己」,会把 AlphaEvolve 那种有评估器的发现,误读成智能爆炸的前奏。
卡住人类仍在环内的,和卡住循环质量的,是同一件事:评估器。研究方向选择是验证层级最顶上一档,目前没有可靠的机器替代。治理级测量几乎是空的,1250 篇里基础与安全只有 60 篇。想监管「训练循环有没有在自我加速」,文献几乎给不出可审计的方法。
语料是样本不是普查,查询深度上限和补充检索都偏向新论文,2026 年占比 74% 是构造出来的,不能当领域真实结构。中位论文只有几个月,引用数接近 0,不能当影响力。单人标注,大约七分之一补充论文是检索误伤。前沿实验室内部的 RSI 实践几乎不发 arXiv,样本对光谱最右端有系统性审查偏差。Anthropic 那 80% 代码数字来自随笔,综述自己说不当证据。