Bespoke Labs 发布 AutoResearchExam:测 24 小时自动研究 agent

AlexGDimakis · x · 2026-09-24

Bespoke Labs 发布 AutoResearchExam 基准,衡量 agent 在开放式 ML 研究任务上的长期迭代与泛化能力,Emad Mostaque 转发推荐并称「标准 harness 下各模型差距很小,可靠的前沿触手可及」,作者 Alex Dimakis 亦转推。要点:

设计动机是:现有单次/少次评测无法衡量「善用反馈、持续改进」的研究能力,而递归自我改进正依赖于此。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →