Google 提出 RRSI:正则化约束 Agent harness 递归自我改进,OOD 仍涨 4.7 分
google · hf · 2026-09-22
Google Research 的 RRSI 研究指出,LLM agent 的能力很大程度由 harness(提示、控制流、工具、记忆与上下文管理)放大,近期方法通过迭代提出并选择组件级编辑实现 agent 系统层面的递归自我改进(RSI),但容易过拟合训练任务——分布内大涨在 OOD 基准上缩水甚至消失。RRSI 引入正则化原则:- 提议者采用时间退火预算限制单次候选可捆绑的编辑数,并基于演化历史鼓励探索未走轨迹
- 选择器配备 critic(筛除针对特定基准的提议)与 pruner(删掉过小、过贵或不再有用的改动)
这些约束共同偏向可复用的 agent 机制。在覆盖编码、agentic 工作区与工程设计任务的八个基准上,演化目标集最多涨 14.1 分,五个 OOD 基准涨至多 4.7 分,且 harness 运行比未正则化版本少用 30% 策略 token。代码已开源。
「编程与Agent」频道最新
- Grok Build 三连更新:子 agent 默认复用父模型,长任务稳定性大改 — XFreeze · 2026-09-22
- TypeSafe Jev 携手 Spring AI:300 毫秒返回带置信度的结构化判断 — blaizedsouza · 2026-09-22
- Agent 基础设施 Bezalel 迎来首位付费用户,一键接入记忆/邮件/沙盒 — Rasmic · 2026-09-22
- Grok 4.7 多轮迭代做出逼真 Three.js 布料模拟 — minchoi · 2026-09-22
- 单行提示词几分钟做出完整游戏,Grok 4.7 又现生成名场面 — minchoi · 2026-09-22
- Grok 4.7 发布首日:十个极限用例,从抓错到 Blender 建模 — minchoi · 2026-09-22