Agent 复现 NanoGPT 优化,与人类差距一年缩半

MinqiJiang · x · 2026-08-16

Minqi Jiang 指出,在自动 NanoGPT Speedrun 基准上,自动化 agent 用一年多时间把与人类水平的差距又缩小了一半。他判断:只要问题定义清晰(如 nanogpt speedrun、验证损失等任何指标),智能体系统最终都会在这些指标上超越人类;真正的大问题是,它们能否同样攻克定义不清晰的「问题的问题」。

引用的原推来自基准作者 Bingchen Zhao 团队:他们去年用当时的前沿模型跑了约 6000 次实验,结论是 LLM 难以做出真正新颖的算法改进,最佳成绩只追回了与人类纪录差距的 40%;今年这个数字已被 Fable 5 推到 80%,也许明年就能真正超越人类。相关论文《The Automated LLM Speedrunning Benchmark: Reproducing NanoGPT Improvements》(arXiv:2506.22419)基于社区 NanoGPT speedrun 构建了 19 个任务,让 agent 拿到上一个纪录的训练脚本,并可选三种形式的提示(从伪代码到论文式描述),考察其复现改进的能力。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →