Google 发布 RRSI 论文:正则化约束 Agent 递归自改进防过拟合
cihangxie · x · 2026-09-23
Google 团队发布论文 RRSI: Regularized Recursive Self-Improvement of Agent Harnesses(arXiv:2609.24972,附代码与项目页),并开源实现。
- 问题:LLM Agent 的能力很大程度由 harness(prompt、控制流、工具、记忆、上下文管理)放大,近期方法通过迭代编辑 harness 实现「递归自改进」(RSI),但这类演化会记住训练任务——分布内大涨的分在分布外 benchmark 上缩水甚至消失。
- 方法:把正则化原则引入 harness 自改进,从两头约束:提案方(proposer)用随时间退火的编辑预算限制单次候选捆绑的修改数,并基于演化历史鼓励未探索轨迹;选择方(selector)配备 critic 过滤针对特定 benchmark 的提案,pruner 剔除太小、太贵或不再有用的修改。
- 效果:这些约束让演化偏向可复用的通用机制而非刷题式修改,在覆盖编码、agentic workspace 与工程的 8 个 benchmark 上验证。
所属事件:Google 提出 RRSI:正则化约束 Agent 框架递归自我改进(8 条相关)→
「编程与Agent」频道最新
- Qwen 团队开源 QwenGyre:超长程 Agent 在线 RL 训练框架 — Qwen · 2026-09-29
- 梗图:用户威逼利诱 agent 执行自己的「烂计划」 — mike64_t · 2026-09-29
- Agent 记忆该有保质期:作者提出六字段记忆元数据框架 — Hairy-Difficulty-411 · 2026-09-29
- 开发者搭桥:网页版 ChatGPT 通过远程 MCP 直接操作本地电脑 — ChoasMaster777 · 2026-09-29
- 99 秒演示:用 MCP 给 Agent 加终端+浏览器受控执行与审批边界 — ImaginaryMachine9110 · 2026-09-29
- SolarMind 亮相:带持久记忆的 AI 事故响应 Agent 四级自动分诊 — CountyNecessary4030 · 2026-09-29