首篇AI4AI综述:AI能改进AI,但「组合鸿沟」挡住递归自我改进
新智元 · wechat · 2026-09-11
研究地图
首篇AI for AI(AI4AI)综述论文梳理数百项研究,把long horizon智能体、AI4AI与递归自我改进(RSI)放进同一框架,追问「AI能否可靠地改进AI并让进步持续积累」。
三大发现
- 组合鸿沟(composition gap):检索、编程、工具调用等单项能力过关,不等于完整研发流程可靠。失败常发生在步骤交接处——代码更新了但分析用了旧日志、指标涨了但对照组配置不同。Long horizon的关键是前一步影响后一步,系统需在结果延迟出现时保持目标、版本和证据一致。
- 会执行≠掌握研究过程:AI承担规划、编程、实验,但研究目标和评价标准通常仍由人类决定。改进分两侧:模型侧学会规划与从长反馈中学习;Harness侧(工具、记忆、执行、检查机制)负责保存实验记录、核对结果、判断何时停止或请人。
- 涨分≠持续变强:判断改进需看四类不可替代的证据——Measured Gain(真的提高了吗)、Retention(迭代后收益还在吗)、Human Comparison(同预算下比人类如何)、Held-out Transfer(换任务还有效吗)。多轮迭代未必更好:系统可能遗忘约束、迎合评分方式或丢失此前收益。
结论:现有证据支持有边界的肯定——AI能在明确目标与评价规则下帮助改进AI,但可靠的研究判断、持久可迁移的收益与跨代累积的改进仍待验证。对开发者的启示:完整流程失败时,先检查哪次交接丢失了关键信息,而非继续刷单项分数。
「编程与Agent」频道最新
- Codex 经 MCP 驱动达芬奇剪片:素材、字幕、混音全自动 — yungcontent · 2026-09-11
- 网友撞见神秘浏览器使用 RL 训练环境,疑似某厂商 agent 训练现场外泄 — xeophon · 2026-09-11
- GPT-6 Astra + Blender MCP 直出浏览器 3D 游戏,WASM+WebGPU 绕开 ThreeJS — chongdashu · 2026-09-11
- AI agent 上线首日即被砍:集成质量比模型能力更决定生死 — arthaudm · 2026-09-11
- 用每周 agent 简报替掉 3 小时周一晨会,作者复盘收获与盲区 — Friendly_Parsnip_472 · 2026-09-11
- 128GB 笔记本本地跑 Qwen3.8 做 Agent 编码,思考 token 才是耗时瓶颈 — deepu105 · 2026-09-11