AIDE^2 让 AI 研究 agent 递归自我改进,8 天迭代 7 次
WecoAI · hf · 2026-09-23
WecoAI 提出 AIDE^2,一个实现 AI 研究 agent 递归自我改进(recursive self-improvement)的系统:agent 对自身代码提出修改,在一套 AI R&D 任务上对修改版本进行基准测试,并保留在隐藏评测中表现最好的改动。要点:
- 自主运行 8 天,连续发现 7 项改进,包括新搜索策略与压缩管理 agent 上下文的记忆机制
- 收益泛化到 4 个 held-out 基准(机器学习工程、启发式算法工程、物理天气预测),最强发现的 agent 达到或超过 FML-Bench 上排名前列的人工设计生产级研究 agent
- 在独立 held-out 任务族上,发现的 agent reward hacking 率从 55% 降到 32%,比人工设计 agent 低 7 个百分点——这是循环从未显式优化的属性
作者称该循环是对抗研发投入边际收益递减长期趋势的一种途径。
「漫话AGI」频道最新
- 生物科技创始人:AI 让研发效率提升 10-100 倍 — zakkohane · 2026-09-23
- AI 风险无需 EA 哲学包装:控制不了比我们都聪明的东西 — austinc3301 · 2026-09-23
- AI 最先吞噬的可能是年轻人攒经验的第一份工作 — yi111 · 2026-09-23
- Agent 的 browser use 已够用:对白领而言 AGI 已经到来 — yihui_indie · 2026-09-23
- Grimes 前夫研究者断言:LLM 证明直觉推理胜过精算式逻辑 — granawkins · 2026-09-23
- Anthropic 研究员:AI 时代做科研该选的三类问题 — CatAstro_Piyush · 2026-09-23