RSIBench-Data 基准测试:让 AI 智能体自动化迭代训练数据

cwolferesearch · x · 2026-07-31

研究者介绍了 RSIBench-Data,一个专注于递归自我改进(RSI)数据层面的全新基准测试。它通过固定训练设置(基于 Tinker),测试让编码智能体迭代优化另一个独立 LLM 的训练数据。

智能体的工作流如下:

当前表现与挑战:

目前前沿模型在该基准上的表现并不理想。虽然早期常能取得初步收益,但很难实现单调提升,甚至经常出现性能退化。作者指出,目前的设置更像是暴力搜索数据组合以寻找简单的捷径。此外,防止数据污染(如智能体自行搜索 ArXiv 寻找公开基准的混合策略)也是一大难点。

尽管如此,作者对智能体在以数据为中心的研究中发挥的作用充满期待,认为未来可通过提供聚类、搜索工具或调用外部 LLM 评估等手段,大幅提升长周期复杂数据研究的效率。

所属事件:RSIBench-Data:评估AI智能体递归改进训练数据的新基准(5 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →