研究揭示 Agent 自我改进易陷入局部最优

omarsar0 · x · 2026-08-23

一篇关于递归自我改进(RSI)的论文分析了大量公开的 Agent 后训练轨迹。研究发现,Agent 在训练的第一步就会锁定其训练策略,并在随后的所有预算中仅在该策略内部进行局部调整,缺乏探索新策略的能力。这种“锁定”现象解释了为何当前模型难以实现真正的 RSI。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →