专题 · FULL STORY
Google RRSI:Agent递归自我改进从论文到开源
Google 联合多机构研究者于 9 月下旬发布 RRSI 论文,提出用正则化约束让 Agent 在冻结参数下实现递归自我改进;一周后项目正式开源,该技术路线从研究走向可用工具。
2026-09-22 ~ 2026-09-29 · 2 集 · 10 条
第 1 集 · Google 提出 RRSI:正则化约束 Agent 框架递归自我改进(2026-09-22,8 条)
Google 研究团队(Han Rujun、Huaxiu Yao 等,2026-09-21 提交 arXiv:2609.24972)发布论文《RRSI: Regularized Recursive Self-Improvement of Agent Harnesses》,研究如何对 agent 框架(harness,即提示、控制流、工具、记忆与上下文管理)的递归自我改进施加正则化约束,并开源了代码与项目页。当前结论:正则化后的 RSI 在分布外任务上仍能带来提升,缓解了自改进过拟合问题。
已确认
- 研究出发点:LLM agent 的能力很大程度由 harness 放大,近期方法通过迭代提出并选择组件级编辑,实现 agent 系统层面的递归自我改进(RSI)
- 团队指出,当前让 Agent 自动改写自身 prompt、工具、记忆与工作流的「自改进」方法往往只在练过的任务上涨分,换到新任务收益常消失甚至归零,本质是过拟合
- Elias (omarsar0) 转述该论文的警示角度:自动优化 harness 会让评测分数上涨,但 agent 在真实任务上反而变差,即 benchmark 表现与真实能力脱节
- RRSI 的解法是把正则化引入递归自改进过程,约束改进方向,使框架自我进化时少过拟合
- 效果:在分布外(OOD)任务上仍提升 4.7 分,并节省约 30% 的 token
- Kangwook Lee 在转发中补充对比视角:权重空间正则化(如 L2)基于对函数平滑性/简单性的假设,而 RSI 场景下需要针对 agent 框架层面的正则化思路
为什么重要
- RSI 正在改变 AI 智能体的进化方式,但若改进只停留在对训练任务的过拟合,泛化能力受限;RRSI 提供了一个简单有效的正则化方案,为构建可泛化、可自我进化的 agent 框架提供了参考路径
- Google 提出 RRSI:正则化约束 Agent harness 递归自我改进,OOD 仍涨 4.7 分 — google · 2026-09-22
- RRSI 论文:正则化让智能体框架自我进化少过拟合,涨 4.7 分省 30% token — HuaxiuYaoML · 2026-09-22
- RRSI 论文:用正则化让 Agent 框架递归自我改进 — _akhaliq · 2026-09-23
- 论文:RRSI,给智能体递归自我改进加上正则化 — HuaxiuYaoML · 2026-09-23
- 研究者警告:自改进 Agent 大概率在过拟合训练任务 — HuaxiuYaoML · 2026-09-23
- Google 发布 RRSI 论文:正则化约束 Agent 递归自改进防过拟合 — cihangxie · 2026-09-23
- RRSI 研究提出正则化递归自我改进,提升 Agent Harness 鲁棒性 — Kangwook_Lee · 2026-09-23
- Google 论文:自动优化 agent harness 会让分数涨、真实任务变差 — omarsar0 · 2026-09-24
第 2 集 · Google 开源 RRSI:冻结参数下 Agent 递归自我改进(2026-09-28,2 条)
Google Research 联合 UNC、Stanford 等机构发布并开源 RRSI(Regularized Recursive Self-Improvement),通过正则化约束让 Agent 在模型参数冻结的前提下递归地自动改进自身框架。该方法在 Terminal-Bench 上将成绩提升至 80.2%,在分布外基准上最高提升 4.7 分,为不更新参数的持续自我改进提供了新路径。
- RRSI 正则化约束智能体递归自我改进,分布外基准最高提升 4.7 分 — burny_tech · 2026-09-28
- Google 开源 RRSI:Agent 自动迭代自身框架,Terminal-Bench 提至 80.2% — sudoraohacker · 2026-09-29