RRSI 正则化约束智能体递归自我改进,分布外基准最高提升 4.7 分
burny_tech · x · 2026-09-28
Google Cloud AI Research 联合 UNC、Stanford 等机构发布论文 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses)。
核心问题:LLM 智能体的能力很大程度由其 harness(prompt、控制流、工具、记忆与上下文管理)放大。现有方法通过迭代提议和筛选 harness 组件编辑实现递归自我改进(RSI),但这种进化容易过拟合训练任务——分布内提升显著,在分布外基准上却缩水甚至消失。
方法:将正则化原则引入 harness 自我进化——
- 提议者使用随时间退火的编辑预算,限制单次候选可捆绑的修改数,并基于进化历史鼓励探索未走过的路径;
- 选择器配备 critic(过滤针对特定基准的提议)和 pruner(移除过小、过于昂贵或已无用的改动)。
结果:在覆盖编码、智能体工作区和工程设计任务的 8 个基准上,RRSI 在自身进化的任务集上最高提升 14.1 分,在 5 个分布外基准上最高提升 4.7 分,且比无正则化的进化少用 30% 的 policy token。
「编程与Agent」频道最新
- Liquid AI 主张端侧跑 Agent:350M-2.6B 模型,推理零按 token 计费 — JosephJacks_ · 2026-09-28
- X bot 创建者计划开启邀请制,agent 数据面板仍缺位 — RachelVT42 · 2026-09-28
- 应对账号配额中断:一条让 agent 断点续跑的提示词技巧 — umeshonai · 2026-09-28
- 用药清单坚持本地处理:Bonsai 2 在 Mac Studio 5.75 秒比对两份清单 — MaziyarPanahi · 2026-09-28
- Claude Opus 5.5 长上下文跑崩?外部 SESSION_STATE.md 状态协议解法 — dr_cintas · 2026-09-28
- 数据标注商预测:营收主力将转向财富1000强而非AI实验室 — Scobleizer · 2026-09-28