Bespoke Labs 发布 AutoResearchExam:测 24 小时自动研究 agent
AlexGDimakis · x · 2026-09-24
Bespoke Labs 发布 AutoResearchExam 基准,衡量 agent 在开放式 ML 研究任务上的长期迭代与泛化能力,Emad Mostaque 转发推荐并称「标准 harness 下各模型差距很小,可靠的前沿触手可及」,作者 Alex Dimakis 亦转推。要点:
- 覆盖 29 个开放式 ML 研究任务,考察 24 小时 auto-research 过程中 agent 提升私有测试集分数的速度。
- 核心指标为 hidden-test AUARC(AutoResearch 曲线下面积),区分验证集上的可见进步与对隐藏测试集的真实泛化,防止把过拟合当进步。
- 附时间、成本与行为分析:不同评估窗口下排名会变化,单一时间预算会掩盖模型差异;并比较成本效率与各 agent 分配研究精力的方式。
设计动机是:现有单次/少次评测无法衡量「善用反馈、持续改进」的研究能力,而递归自我改进正依赖于此。
「编程与Agent」频道最新
- 三智能体最小架构:Builder-Reviewer-Verifier 循环即可逼近完美 — BLUECOW009 · 2026-09-24
- Claude Opus 5.5登顶编码智能体指数,单任务成本反升21% — ArtificialAnlys · 2026-09-24
- 发帖后ARR再增200万美元:客户弃工具自建Claude工作流 — garrytan · 2026-09-24
- Qwen Image 2.1 局部重绘实操:接线与提示词差异全解析 — Reasonable_Arm7239 · 2026-09-24
- 用小模型当 Agent 大脑,声称可大幅砍掉 Agent 账单 — blaizedsouza · 2026-09-24
- PatronusAI 评测圆桌:从 SpeedrunBench 到表格公式 agent 评测 — DynamicWebPaige · 2026-09-24