Google 开源 RRSI:Agent 自动迭代自身框架,Terminal-Bench 提至 80.2%
sudoraohacker · x · 2026-09-29
Google Research 开源 RRSI(Regularized Recursive Self-Improvement),让 Agent 在模型参数冻结的前提下自动改进自己的 harness——提示词、控制流、工具、记忆与上下文管理,并用评测决定哪些修改值得保留。
针对 harness 自进化常见的过拟合问题(在训练任务集上大涨、出分布就失效),RRSI 在提案与筛选两侧加了约束:
- 提案侧:退火预算限制单次候选可捆绑的独立修改数;proposer 以完整修改历史为条件,避免重提已证伪的假设;停滞时引导向未覆盖的组件探索
- 筛选侧:critic 在评测前筛查针对测试集的特化逻辑;收益须超过评测噪声;清理不再有效的组件
据项目报告,固定 Claude Opus 4.8,Terminal-Bench 2.1 从 74.2% 升至 80.2%;未参与迭代筛选的 SWE-bench Verified 从 82.0% 升至 83.8%。项目已附论文与项目页,实际收益仍需在自己任务上验证。
所属事件:Google 开源 RRSI:冻结参数下 Agent 递归自我改进(2 条相关)→
「编程与Agent」频道最新
- 用截图和免费 wav,Claude Opus 复刻《哈利波特》乐谱动画 — justin_hart · 2026-09-29
- OpenAI 发布 Workspace Agents:云端 24/7 常驻团队智能体,可接 Slack 与 MCP — testingcatalog · 2026-09-29
- BaRe-Mem:贝叶斯可靠性记忆让多智能体咨询不再被误导 — NanyangTechnologicalUniversity · 2026-09-29
- SkillDRE:双阶段红队进化恶意 Agent 技能,攻击成功率 45.28% — Pengyu Zhu · 2026-09-29
- 19岁学生用 Claude Code 两天搭套利机器人,自称 $68 赚到 75 万美元 — Aiden_Tech_Ai · 2026-09-29
- 构建期用Agent改流程图、运行期纯脚本:海量浏览器任务省token方案 — ZennoLab_Guru · 2026-09-29