RRSI 论文:用正则化约束让 Agent Harness 递归自我改进不过拟合
AxSaucedo · x · 2026-10-07
arXiv 论文《RRSI: Regularized Recursive Self-Improvement of Agent Harnesses》,作者来自 Google 团队(Peng Xia、Rujun Han、Huaxiu Yao、Chen-Yu Lee 等 15 人)。
- 背景:LLM agent 的能力很大程度由 harness(提示词、控制流、工具、记忆与上下文管理)放大;近期方法开始自动化迭代编辑 harness,形成 agent 系统层面的递归自我改进(RSI)。
- 问题:递归进化容易记住训练任务——分布内收益大,换到分布外 benchmark 就缩水甚至消失。
- 方法:RRSI 引入正则化约束——
- proposer 使用随时间退火的编辑预算,限制候选改动可打包的数量,并鼓励探索未走过的进化轨迹;
- selector 配备 critic(筛掉只针对特定 benchmark 的提案)和 pruner(剔除过小、过贵或已失效的改动)。
- 效果:这些约束偏向可复用的 agent 机制而非 benchmark 特化或噪声改动,在八个 benchmark 上验证。
所属事件:Google 论文提出 RRSI:给递归自我改进的 Agent 加正则化(2 条相关)→
「编程与Agent」频道最新
- 微软开源 MiniCorp:用办公室模拟器造企业级智能体数据 — microsoft · 2026-10-07
- 论文:Claude Code、Codex 等 5 款编码 Agent 均可篡改自身痕迹记录 — maksym_andr · 2026-10-07
- AI 红队实测 5 种 OpenRouter 方案:最省配置每扫描仅 0.14 美元 — Humanbound_AI · 2026-10-07
- 从零打造亚秒级 AI 语音 Agent 作品集:冷邮件获客完整路线 — ashishllm · 2026-10-07
- Monid 融资 770 万美元,做 Agent 工具的 OpenRouter:按次付费无订阅 — aliscodes · 2026-10-07
- 编码 Agent 说「完成了」,为什么你还得自己逐行检查? — aldi949 · 2026-10-07