RSIBench-Data 首测 Agent 递归自我改进能力

arXiv 新论文提出 RSIBench-Data 基准,首次系统测试了 LLM Agent 的递归自我改进能力。实验表明,前沿 Agent 能够通过反馈优化数据策略,在 24 组实验中有 14 组超越了首次尝试的表现。然而,研究也发现 Agent 普遍存在难以“及时停手”的问题,往往在达到最佳改进点后继续优化反而导致效果下降,凸显了自动化科研中控制停止时机的重要性。

2026-07-29 ~ 2026-07-29 · 2 条相关