Grok 4.7 登 AutoResearchExam 长程研究榜,24 小时自动研究排第 4
AlexGDimakis · x · 2026-09-24
Bespoke Labs 的 AutoResearchExam 实时榜新增 Grok 4.7:30 分钟自动研究排第 3,4 小时回落到第 4,24 小时后最终位列第 4。作者评价其性能与成本的整体权衡「相当不错」。
该基准衡量 agent 在 24 小时自动研究中改进开放式 ML 研究任务的能力,核心指标是隐藏测试集 AUARC(自动研究曲线下面积),同时考察验证分数的提升速度与泛化能力,覆盖 29 个任务。其设计动机是:一次性和少样本评测无法捕捉研究迭代过程,排名会随评测时间窗口变化,单一时间预算的跑分容易漏掉模型差异;榜单还比较了各 agent 的成本效率与研究精力分配方式。
「模型」频道最新
- Box 实测 Opus 5.5:token 省 63%,速度提升 30% 且更便宜 — bcherny · 2026-09-24
- Claude Opus 5.5 Max 登顶 Code Arena,领先 GPT-6 Astra 26 分 — airesearch12 · 2026-09-24
- Pokee 36B 智能体模型跑通骁龙 X2 Elite:32GB 内存全本地 — Kyrannio · 2026-09-24
- Opus 5.5 爱跑 rm -f 删文件,用户被迫反复劝阻 — gandamu_ml · 2026-09-24
- 第三方实测:AssemblyAI Universal 3.5 Pro 语音转写准确率延迟双冠 — AssemblyAI · 2026-09-24
- Jev 被指比 DeepSeek 更值得警惕:API 即用、几分钱一次决策,让浪费无处遁形 — jobergum · 2026-09-24