专题 · FULL STORY

Google RRSI:Agent递归自我改进从论文到开源

Google 联合多机构研究者于 9 月下旬发布 RRSI 论文,提出用正则化约束让 Agent 在冻结参数下实现递归自我改进;一周后项目正式开源,该技术路线从研究走向可用工具。

2026-09-22 ~ 2026-09-29 · 2 集 · 10 条

第 1 集 · Google 提出 RRSI:正则化约束 Agent 框架递归自我改进(2026-09-22,8 条)

Google 研究团队(Han Rujun、Huaxiu Yao 等,2026-09-21 提交 arXiv:2609.24972)发布论文《RRSI: Regularized Recursive Self-Improvement of Agent Harnesses》,研究如何对 agent 框架(harness,即提示、控制流、工具、记忆与上下文管理)的递归自我改进施加正则化约束,并开源了代码与项目页。当前结论:正则化后的 RSI 在分布外任务上仍能带来提升,缓解了自改进过拟合问题。

已确认

  • 研究出发点:LLM agent 的能力很大程度由 harness 放大,近期方法通过迭代提出并选择组件级编辑,实现 agent 系统层面的递归自我改进(RSI)
  • 团队指出,当前让 Agent 自动改写自身 prompt、工具、记忆与工作流的「自改进」方法往往只在练过的任务上涨分,换到新任务收益常消失甚至归零,本质是过拟合
  • Elias (omarsar0) 转述该论文的警示角度:自动优化 harness 会让评测分数上涨,但 agent 在真实任务上反而变差,即 benchmark 表现与真实能力脱节
  • RRSI 的解法是把正则化引入递归自改进过程,约束改进方向,使框架自我进化时少过拟合
  • 效果:在分布外(OOD)任务上仍提升 4.7 分,并节省约 30% 的 token
  • Kangwook Lee 在转发中补充对比视角:权重空间正则化(如 L2)基于对函数平滑性/简单性的假设,而 RSI 场景下需要针对 agent 框架层面的正则化思路

为什么重要

  • RSI 正在改变 AI 智能体的进化方式,但若改进只停留在对训练任务的过拟合,泛化能力受限;RRSI 提供了一个简单有效的正则化方案,为构建可泛化、可自我进化的 agent 框架提供了参考路径

第 2 集 · Google 开源 RRSI:冻结参数下 Agent 递归自我改进(2026-09-28,2 条)

Google Research 联合 UNC、Stanford 等机构发布并开源 RRSI(Regularized Recursive Self-Improvement),通过正则化约束让 Agent 在模型参数冻结的前提下递归地自动改进自身框架。该方法在 Terminal-Bench 上将成绩提升至 80.2%,在分布外基准上最高提升 4.7 分,为不更新参数的持续自我改进提供了新路径。