Grok 4.7 登 AutoResearchExam 长程研究榜,24 小时自动研究排第 4

AlexGDimakis · x · 2026-09-24

Bespoke Labs 的 AutoResearchExam 实时榜新增 Grok 4.7:30 分钟自动研究排第 3,4 小时回落到第 4,24 小时后最终位列第 4。作者评价其性能与成本的整体权衡「相当不错」。

该基准衡量 agent 在 24 小时自动研究中改进开放式 ML 研究任务的能力,核心指标是隐藏测试集 AUARC(自动研究曲线下面积),同时考察验证分数的提升速度与泛化能力,覆盖 29 个任务。其设计动机是:一次性和少样本评测无法捕捉研究迭代过程,排名会随评测时间窗口变化,单一时间预算的跑分容易漏掉模型差异;榜单还比较了各 agent 的成本效率与研究精力分配方式。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →