AIDE² 八天自改进超越两年手调
WecoAI 的 AIDE² 实验近日被多条帖子集中讨论:团队让“自动研究”系统继续研究并改写“自动研究代理”本身,连续运行 8 天后,在留出 benchmark 上超过了他们过去 2 年手工调优的 harness。之所以受到关注,是因为它把“递归自我改进”从概念争论推进到了可测的智能体实验;但围绕这一结果能外推出什么,讨论很快出现分歧。
实验设计
按 @latticecut 的梳理,AIDE² 采用内外两层循环:内层智能体负责完成研究任务,外层智能体根据执行表现重写内层的代码框架或 harness,再通过测试验证改写效果,只有表现更好的版本会被保留。系统总共进行了约 100 次迭代。
另有转述把 AIDE²/GoalOS 描述为在“智能体操作系统”层做改进,而不只是优化单个 agent。在这种说法里,被联动优化的对象还包括 jobs、tools、validators、memory、goals 等组件。
解读分歧
@EchoOfOppenheimer 将其称为递归自我改进(RSI)的首个实验性证据。相比之下,@GaryMarcus 在转述论文时强调,实验中每轮自我改进的收益呈明显递减,拟合出的增长关系约为 [Intelligence]^0.075;按他的解读,这离“失控式自我提升”所需的线性或超线性增长还很远。
@KordingLab 转发的观点也持类似谨慎态度:即便这个实验支持某种形式的 RSI,也不能仅凭这一点就推出“奇点”临近。
2026-07-15 ~ 2026-07-16 · 12 条相关
一手来源
- AI智能体实现递归自我改进实验 — latticecut ·
- 自我改进代理实验被称有进展 — ChengleiSi · 2026-07-15
- AIDE² 自研超越手调版本 — PMinervini · 2026-07-15
- AIDE2展现递归自改进 — TinfoilTricorn · 2026-07-15
- RSI首个实验性证据 — EchoOfOppenheimer · 2026-07-15
- 智能体递归自我改进实验 — markjeffrey · 2026-07-15
- RSI论文:看不到快速起飞 — GaryMarcus · 2026-07-15
- 【源头】AI智能体实现递归自我改进实验 — latticecut · 2026-07-15
- 智能体操作系统与自改进实验 — Ghost_Pilot_MD · 2026-07-15
- RSI 的实验性证据:自动研究代理自改进 — JensHonack · 2026-07-16
- GoalOS 展示三代递归自我改进 — Ghost_Pilot_MD · 2026-07-16
- Weco AI 展示递归自我改进 — blaizedsouza · 2026-07-16
- RSI 实验引发奇点争论 — KordingLab · 2026-07-16