RSIBench-Data 基准测试 AI Agent 的数据研究能力
rohanpaul_ai · x · 2026-07-29
RSIBench-Data:测 AI Agent 能否像研究员一样做数据研究
这篇论文提出了 RSIBench-Data,一个面向递归自我改进的受控基准,专门评估 LLM agent 是否能做“数据中心”的研究工作。
- 它把后训练栈固定住,尽量把评测重点放在研究决策本身,而不是优化、部署或系统实现。
- Agent 需要围绕一个固定目标模型,反复修改训练数据策略,并根据正式评测反馈继续迭代。
- 基准覆盖 6 个任务,来自软件工程、终端操作、科学问答和数学。
- 4 个前沿 agent 在 58.33% 的设置里,能通过改进策略优于第一次有效尝试,但表现并不稳定。
- 在继续搜索、却已经超过最佳分数之后的轨迹里,78.26% 最终落到更差的结果,说明好方案往往出现在较早或中段。
所属事件:RSIBench-Data评测Agent数据研究能力(4 条相关)→
「编程与Agent」频道最新
- GitHub 示例展示可真实预约的 LangGraph 调度 agent — hwchase17 · 2026-07-29
- 一本编程书的反浅层抽象观点,在智能体时代更适用 — tdhopper · 2026-07-29
- SiteSpeakAI 教你把 ChatGPT 支持代理嵌入 Replit 应用 — hermanschutte · 2026-07-29
- 让 Codex 完成后自动邮件汇总改动 — reach_vb · 2026-07-29
- Reddit 讨论:哪些 AI agent 用例最值得企业优先自动化 — omnidimension85 · 2026-07-29
- 为什么执行轨迹看不出 agent 是否真的用了检索内容 — PersonalityWhich1780 · 2026-07-29