Bespoke Labs 推出 AutoResearchExam:29 项开放 ML 研究任务测智能体
AlexGDimakis · x · 2026-09-25
Bespoke Labs(Dimakis 参与)发布新基准 AutoResearchExam,衡量智能体在长时段开放式 ML 研究任务上的持续改进与泛化能力。
要点:
- 29 项任务、24 小时自动研究窗口:衡量指标为 hidden-test AUARC(自动研究曲线下面积),同时考虑解的质量、对隐藏测试集的泛化以及达成速度。
- 区分「刷分」与「真泛化」:智能体只优化验证集分数,排名由隐藏测试集决定,以避免在验证集上过拟合被误判为进步。
- 时间预算影响排名:分析显示不同评估窗口下智能体排名会变化,单一时间预算会掩盖模型间差异;报告还对比了成本效率与智能体分配研究精力的方式。
- 最新榜单上 Opus 5.5 登顶,并重新定义了性能-成本 Pareto 前沿,把 Fable 5.1 和 Astra 6 挤出前沿。
所属事件:Bespoke Labs 发布 AutoResearchExam 基准测自动研究智能体(2 条相关)→
「模型」频道最新
- GPT-Sol 输出中文非重度量化所致,实为语言混淆与采样器浮点问题 — AryHHAry · 2026-09-25
- TypeSafe 推出 Jev:校准置信度、约束输出格式的新模型 — tech_technical · 2026-09-25
- 曝 OpenAI 数周内预览 GPT-6 Cyber,将推首个网络安全专用产品 — jeremyakahn · 2026-09-25
- 视觉模型梯队图更新:Opus 5.5、GPT-6 双版本与 Grok 4.7 入列 — ducha_aiki · 2026-09-25
- 爆料:Anthropic 新模型发布数周后惯常被降智 — iannuttall · 2026-09-25
- 实测:Qwen Flash Next IQ4_XS 四项基准全面胜过 27B FP8 — smallDeltaBigEffect · 2026-09-25