AutoLab 基准显示前沿模型靠持续迭代赢下长任务
rohanpaul_ai · x · 2026-07-22
AutoLab 发现:长时程研究任务,胜负关键不是第一步有多准
论文提出了 AutoLab 基准,共 36 个长时程任务。每个任务都从一个“能跑但很弱”的代码起点开始,要求智能体在固定时间内持续改进。
- 任务覆盖 系统加速、谜题、模型开发、CUDA kernel 优化 等不同场景。
- 作者测试了 17 个前沿模型,发现决定成败的并不是最初想法有多聪明,而是智能体能否持续测试、反复迭代,并把反馈真正用进去。
- Claude Opus 4.6 在榜单上领先,并不是因为它总能一开始就猜对,而是因为它会反复 benchmark,把实验结果融入下一轮尝试。
- 其他一些前沿模型的失败方式也很有代表性:要么 提前放弃,明明还有时间却不继续做;要么 想太久,最后连有用结果都没提交出来。
这篇论文想说明:当前研究型 agent 仍然卡在“持续做长期工作”这一步,长期迭代能力才是真正的短板。
「模型」频道最新
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11
- 网友吐槽 GPT-5.6 文笔好读但缺乏记忆点 — BasedRaddka · 2026-09-11
- Opus 以"安全"为由拒碰蛋白质生成代码,开发者吐槽误伤 — josephdviviano · 2026-09-11
- 网友称 DeepSeek 4.1 Flash 是语言模型历史拐点(未证实) — himanshustwts · 2026-09-11