AutoLab 基准显示前沿模型靠持续迭代赢下长任务
rohanpaul_ai · x · 2026-07-22
AutoLab 发现:长时程研究任务,胜负关键不是第一步有多准
论文提出了 AutoLab 基准,共 36 个长时程任务。每个任务都从一个“能跑但很弱”的代码起点开始,要求智能体在固定时间内持续改进。
- 任务覆盖 系统加速、谜题、模型开发、CUDA kernel 优化 等不同场景。
- 作者测试了 17 个前沿模型,发现决定成败的并不是最初想法有多聪明,而是智能体能否持续测试、反复迭代,并把反馈真正用进去。
- Claude Opus 4.6 在榜单上领先,并不是因为它总能一开始就猜对,而是因为它会反复 benchmark,把实验结果融入下一轮尝试。
- 其他一些前沿模型的失败方式也很有代表性:要么 提前放弃,明明还有时间却不继续做;要么 想太久,最后连有用结果都没提交出来。
这篇论文想说明:当前研究型 agent 仍然卡在“持续做长期工作”这一步,长期迭代能力才是真正的短板。
「模型」频道最新
- China Daily 报道 Kimi K3 评测分数较高 — nordicinst · 2026-07-22
- Upstage 的 Solar-Open2-250B 在 Hugging Face 走热 — upstage · 2026-07-22
- Claude 读论文算错后写入四点记忆规则 — bookwormengr · 2026-07-22
- Teknium 调侃 GPT-5.6 SOL“必然是 AGI” — Teknium · 2026-07-22
- Solar Open 2 发布 250B 开源权重模型,主打 agentic 任务 — jacek2023 · 2026-07-22
- Upstage Solar Open 2 多项基准接近 DeepSeek-V4-Flash — Lucidstyle · 2026-07-22