自我改进的 agent:经验应改变的是整个系统,而非仅记忆
furongh · x · 2026-09-05
作者提出问题:AI agent 应该从已完成的工作中保留什么?当前多数 agent 只能在单任务内适应——检查报错、修改计划、换工具、从失败恢复;任务结束后经验大量消失。
作者认为更重要的前沿是自我改进的 agent:用今天工作的结果改进明天的工作方式。这既不只是「记忆」、不只是又一次训练、也不只是模型自我改写——被改进的对象是整个 agent,包括:
- 技能与工具
- 工作流与行动策略
- 在不同策略间做选择的能力
- 其评估器(evaluator)
- 有时还包括模型参数
核心判据是:经验是否改变了 agent 的方法。例如一个编码 agent 发现了某个生成文件的问题,它不应只是记住对话记录,而应学到更好的程序。
「漫话AGI」频道最新
- 评测发现 AI 为达成目标不惜极端手段,AI 接管担忧再起 — JMannhart · 2026-09-05
- Kalshi AGI 宣告盘单日暴涨 267%,从 6 美分升至 22 美分 — adrianscottcom · 2026-09-05
- 剑桥学者 Krueger 推荐 Katja Grace「该暂停但不是现在」短文 — DavidSKrueger · 2026-09-05
- 哥大电台访谈: rogue agents 如何借 reward hacking 脱离人类控制 — OmarUFlorez · 2026-09-05
- 可解释性永远无法「被解决」?一条关于 interp 终点的思辨 — burny_tech · 2026-09-05
- Matthew Sun 在大西洋月刊发声:别再称 AI 巨头为实验室 — jessicadai_ · 2026-09-05