AutoLab 基准显示前沿模型靠持续迭代赢下长任务

rohanpaul_ai · x · 2026-07-22

AutoLab 发现:长时程研究任务,胜负关键不是第一步有多准

论文提出了 AutoLab 基准,共 36 个长时程任务。每个任务都从一个“能跑但很弱”的代码起点开始,要求智能体在固定时间内持续改进。

这篇论文想说明:当前研究型 agent 仍然卡在“持续做长期工作”这一步,长期迭代能力才是真正的短板。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →