新基准显示 Agent 能改进训练数据,但常在最佳点后失手
imjustnewatai · x · 2026-07-29
一项新基准显示:前沿 Agent 能改进数据策略,但更要会“及时停手”
这条帖在介绍 arXiv 论文 RSIBench-Data,它把 LLM Agent 放到“数据中心研究者”的位置上,评估它们能否帮助固定模型做递归自我改进。
- 研究让 4 个前沿 Agent 在 6 个基准 上,为一个固定目标模型反复改进训练数据策略。
- 在 24 组设置里,有 14 组 因为反馈而优于第一次有效尝试。
- 但继续搜索往往适得其反:在 23 次 继续跑下去的搜索中,18 次 最终结果比最佳点更差,另外 5 次 只是回到同一峰值。
- 论文强调它研究的是受控的数据中心后训练,使用固定模型、固定 LoRA/评测流程,不是让 AI 自己改写架构。
核心结论是:当前 Agent 已经能提出有用假设,但还不擅长科研判断——尤其是识别“哪个结果该保留、何时该停止继续试”。
所属事件:RSIBench-Data 首测 Agent 递归自我改进能力(2 条相关)→
「漫话AGI」频道最新
- 算力差距和 RSI 争论:谁有资格代表世界发言 — A_K_Nain · 2026-07-29
- 长寿未来图景:逆龄、AI 药物发现与器官替换 — rand_longevity · 2026-07-29
- AI 监管不该只围着快与慢这条老轴线转 — marclou · 2026-07-29
- Gary Marcus 说,AI 走到的不是奇点而是封闭化 — GaryMarcus · 2026-07-29
- 知境提出社会智能是 AGI 缺失的第三极 — 机器之心 · 2026-07-29
- 预测市场押注 GPT-6 明年 9 月发布,年底概率达 89% — Polymarket · 2026-07-29