多机构综述重塑「自我改进Agent」版图:快环探索,慢环固化

新智元 · wechat · 2026-08-10

吉林大学、KAUST 等机构联合发布了一篇关于「自我改进 Agent」的综述,将模型训练、记忆演化、工具创建和架构搜索纳入统一框架,并梳理了 312 篇相关研究。

自我改进的边界:论文指出,只有当系统依据自身执行轨迹持久修改了模型参数或外部脚手架(如 Prompt、Memory、Tools),并改变下一次任务的起点时,才算真正的自我改进。一次性的反思或纠错并不算。

两条核心路径:

核心设计原则:成熟的系统应结合双时间尺度——用脚手架进行快速、可逆的探索,再将验证有效的经验蒸馏进模型权重实现慢速固化。此外,随着 Agent 自我修改能力增强,必须引入分层门控等安全机制,防止提示词注入等漏洞被永久写入系统。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →