RSIBench-Data 首测 Agent 递归自我改进能力
arXiv 新论文提出 RSIBench-Data 基准,首次系统测试了 LLM Agent 的递归自我改进能力。实验表明,前沿 Agent 能够通过反馈优化数据策略,在 24 组实验中有 14 组超越了首次尝试的表现。然而,研究也发现 Agent 普遍存在难以“及时停手”的问题,往往在达到最佳改进点后继续优化反而导致效果下降,凸显了自动化科研中控制停止时机的重要性。
2026-07-29 ~ 2026-07-29 · 2 条相关
- 新基准显示 Agent 能改进训练数据,但常在最佳点后失手 — imjustnewatai · 2026-07-29
- RSIBench-Data:首测Agent递归自我改进能力 — imjustnewatai · 2026-07-29