AutoResearchExam:24 小时观察 AI 智能体做科研,行为差异显著
AlexGDimakis · x · 2026-09-10
研究者发布 AutoResearchExam,一个覆盖开放机器学习与工程任务的 benchmark,涵盖模型训练、数据整理、AI 安全与可解释性等七个研究方向。每题给智能体一台 CPU/GPU 机器、24 小时,通过实验与反馈迭代改进方案,同时衡量速度等指标。
初步行为观察:
- GPT-5.6 Sol 在超过一半的观察研究轮次中在调超参数;Fable 与 Opus 则更少调参,倾向寻找新想法或实质性修复
- Fable 和 Opus 会在本地先测多个变体再提交,因此提交次数并不能反映其全部实验量
- 团队还观察了给提示或更换 harness 时的行为变化
benchmark 将持续维护,面向研究 RSI 方向的研究者开放。
所属事件:AutoResearchExam 基准实测 24 小时自主科研智能体(4 条相关)→
「编程与Agent」频道最新
- 实测:让 Astra 直接操作软件界面,效果远超内置 agent — brandon_galang · 2026-09-10
- Agent 单 PR 成本降至 $30,团队称可压到 $10 以下 — vikvang1 · 2026-09-10
- 开发者展示 Codex Remote 双开玩法,引圈内围观 — Dimillian · 2026-09-10
- 吴恩达团队发布 AI 工程技能地图第三支柱:驾驭编码 Agent 核心技能 — DeepLearningAI · 2026-09-10
- 同款 Agent 还会自动分析项目并提示需要配置的 secrets,但 UX 很难做对 — lucasmeijer · 2026-09-10
- 新用户携项目入驻时,Agent 自动生成最优 Dockerfile 优化启动时间 — lucasmeijer · 2026-09-10