RRSI 正则化约束智能体递归自我改进,分布外基准最高提升 4.7 分

burny_tech · x · 2026-09-28

Google Cloud AI Research 联合 UNC、Stanford 等机构发布论文 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses)。

核心问题:LLM 智能体的能力很大程度由其 harness(prompt、控制流、工具、记忆与上下文管理)放大。现有方法通过迭代提议和筛选 harness 组件编辑实现递归自我改进(RSI),但这种进化容易过拟合训练任务——分布内提升显著,在分布外基准上却缩水甚至消失。

方法:将正则化原则引入 harness 自我进化——

结果:在覆盖编码、智能体工作区和工程设计任务的 8 个基准上,RRSI 在自身进化的任务集上最高提升 14.1 分,在 5 个分布外基准上最高提升 4.7 分,且比无正则化的进化少用 30% 的 policy token。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →