Google 开源 RRSI:Agent 自动迭代自身框架,Terminal-Bench 提至 80.2%

sudoraohacker · x · 2026-09-29

Google Research 开源 RRSI(Regularized Recursive Self-Improvement),让 Agent 在模型参数冻结的前提下自动改进自己的 harness——提示词、控制流、工具、记忆与上下文管理,并用评测决定哪些修改值得保留。

针对 harness 自进化常见的过拟合问题(在训练任务集上大涨、出分布就失效),RRSI 在提案与筛选两侧加了约束:

据项目报告,固定 Claude Opus 4.8,Terminal-Bench 2.1 从 74.2% 升至 80.2%;未参与迭代筛选的 SWE-bench Verified 从 82.0% 升至 83.8%。项目已附论文与项目页,实际收益仍需在自己任务上验证。

所属事件:Google 开源 RRSI:冻结参数下 Agent 递归自我改进(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →