Google 提出 RRSI:正则化约束 Agent harness 递归自我改进,OOD 仍涨 4.7 分

google · hf · 2026-09-22

Google Research 的 RRSI 研究指出,LLM agent 的能力很大程度由 harness(提示、控制流、工具、记忆与上下文管理)放大,近期方法通过迭代提出并选择组件级编辑实现 agent 系统层面的递归自我改进(RSI),但容易过拟合训练任务——分布内大涨在 OOD 基准上缩水甚至消失。RRSI 引入正则化原则:- 提议者采用时间退火预算限制单次候选可捆绑的编辑数,并基于演化历史鼓励探索未走轨迹

这些约束共同偏向可复用的 agent 机制。在覆盖编码、agentic 工作区与工程设计任务的八个基准上,演化目标集最多涨 14.1 分,五个 OOD 基准涨至多 4.7 分,且 harness 运行比未正则化版本少用 30% 策略 token。代码已开源。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →