Bespoke Labs 发布 AutoResearchExam:29 项任务测 24 小时自主科研
AashaySachdeva · x · 2026-09-10
Bespoke Labs 发布面向智能体自主科研能力的新基准 AutoResearchExam,包含 29 项开放式 ML 研究任务,测量智能体在 24 小时持续科研窗口内提升私密测试集分数的速度。要点:
- 衡量持续迭代而非一次性作答:真实科研依赖反馈迭代与多路探索,现有 one-shot/long-horizon 基准难以捕捉这种演化,也可能混淆「验证集刷分」与真正泛化。
- 分离可见进步与泛化:智能体优化验证集分数,用隐藏测试集的 AUARC 衡量其找到可泛化解法的速度,防止在验证集上过拟合。
- 时间/成本/行为分析:排名随评估窗口长短而变,说明单一时间预算会漏掉模型间差异;同时比较了成本效率与智能体分配研究精力的方式。
- 实验采用标准 Terminus 2 harness,任务列表已在 GitHub 公开,附排行榜。
作者认为这项工作正当其时:数学与科学领域近期的突破(如纳维-斯托克斯千禧年问题)都需要持续的自主科研与测试时扩展,是通向递归自我改进的关键一环。
所属事件:AutoResearchExam 基准实测 24 小时自主科研智能体(4 条相关)→
「编程与Agent」频道最新
- 实测:让 Astra 直接操作软件界面,效果远超内置 agent — brandon_galang · 2026-09-10
- Agent 单 PR 成本降至 $30,团队称可压到 $10 以下 — vikvang1 · 2026-09-10
- 开发者展示 Codex Remote 双开玩法,引圈内围观 — Dimillian · 2026-09-10
- 吴恩达团队发布 AI 工程技能地图第三支柱:驾驭编码 Agent 核心技能 — DeepLearningAI · 2026-09-10
- 同款 Agent 还会自动分析项目并提示需要配置的 secrets,但 UX 很难做对 — lucasmeijer · 2026-09-10
- 新用户携项目入驻时,Agent 自动生成最优 Dockerfile 优化启动时间 — lucasmeijer · 2026-09-10