AutoResearchExam:24 小时观察 AI 智能体做科研,行为差异显著

AlexGDimakis · x · 2026-09-10

研究者发布 AutoResearchExam,一个覆盖开放机器学习与工程任务的 benchmark,涵盖模型训练、数据整理、AI 安全与可解释性等七个研究方向。每题给智能体一台 CPU/GPU 机器、24 小时,通过实验与反馈迭代改进方案,同时衡量速度等指标。

初步行为观察:

benchmark 将持续维护,面向研究 RSI 方向的研究者开放。

所属事件:AutoResearchExam 基准实测 24 小时自主科研智能体(4 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →