论文复现泼冷水:记忆自我改进 agent 的增益大半靠噪声

dair_ai · x · 2026-08-21

dair-ai 推荐一篇重新评估「记忆型自我改进 agent」的论文。该复现补上了此前工作缺失的两个关键环节:多次运行以测量方差,以及随机打乱任务顺序——结果两者都让原本的收益缩水。

核心发现:多步任务的 agent 评测本身噪声很大,叠加自我改进循环会放大噪声;默认任务顺序构成隐式课程(curriculum),此前报告的增益相当一部分是搭了课程顺序的顺风车。在记忆构建中加入详细评分标准和环境反馈可以挽回部分性能,但仍有显著差距。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →