METR 测出 AI 任务时长每 7 个月翻倍,Claude 3.7 已达 50 分钟

Measuring AI Ability to Complete Long Software Tasks

Thomas Kwa, Ben West, Joel Becker, Amy Deng, Katharyn Garcia, Max Hasin, Sami Jawhar, Megan Kinniment, Nate Rush, Sydney Von Arx, Ryan Bloom, Thomas Broadley, Haoxing Du, Brian Goodrich, Nikola Jurkovic, Luke Harold Miles, Seraphina Nix, Tao Lin, Chris Painter, Neev Parikh, David Rein, Lucas Jun Koba Sato, Hjalmar Wijk, Daniel M. Ziegler, Elizabeth Barnes, Lawrence Chan

NeurIPS 2025

cs.AI, cs.LG

2025-03-19

METR 用「50% 任务完成时长」量化 AI 自主能力:前沿模型当前约 50 分钟,2019 年来每 7 个月翻倍,外推 5 年内追平人类一个月的工作量。

这篇在解决什么

AI 基准测试分数年年新高,但「MMLU 涨了 3 分」对一个真正要部署 agent 的人意味着什么,谁都说不清。METR(Model Evaluation & Threat Research)想把这个抽象问题换成一句人话:现在的 AI,到底能独立撑住多长的活?

他们的做法是把能力换算成时间。不再问「模型在某个 benchmark 上拿多少分」,而是问「人类通常花多久才能做完、而 AI 能以 50% 成功率独立做完的任务,最长有多长」。这个量叫「50% 任务完成时长」(50%-task-completion time horizon)。选 50% 是个折中:太高(比如 95%)数据太稀,太低又说明不了问题。

为了让「时长」可信,他们真去给任务计时:找来有相关领域经验的人(平均约 5 年)实做每个任务,记录从开工到做对要多久。整个数据集攒了 800 多次人类基线、合计 2529 小时。

方法

任务集由三部分拼成:HCAST 的 97 个软件任务(短的 1 分钟、长的 30 小时)、RE-Bench 的 7 个机器学习研究工程任务(每个给 8 小时),以及 66 个新设计的「软件原子动作」(SWAA,单个步骤,1 到 30 秒)。合起来 170 个任务,横跨从秒级到数小时的难度。

模型作为 agent 跑这些任务,允许调用工具、改代码、读报错,跟真实使用场景接近。每个「模型×任务」大约跑 8 次取成功率,再把这个成功率对应回人类完成该任务的中位时长,就得到这个模型在 50% 成功率下的时间长度。

测了 2019 到 2025 年的 12 个前沿模型和 4 个准前沿模型,从 GPT-2 到 o3、Claude 3.7 Sonnet。

结果

把每个模型的「50% 时长」按发布日期画出来,一条近乎笔直的指数曲线:

模型50% 任务完成时长
GPT-2(2019)约 2 秒
o3(2025)约 110 分钟

Claude 3.7 Sonnet 和 o3 能完成多个 4 小时以上的任务。整体翻倍周期约 207 天(95% 置信区间 166 到 240 天),也就是大约 7 个月。2023 到 2025 这段的增速比 2019 到 2025 的整体增速还快约 20%,曲线可能在加速。

80% 成功率的时长比 50% 短 4 到 6 倍:把门槛从「勉强做成」提到「稳定做成」,能力会缩水一个数量级。模型之间哪些任务做得对,相关性约 0.73。

为什么重要

对从业者,这张图给了一个可比的尺子。「某个 agent 部署场景平均要 2 小时无干预运行」这类需求,现在能直接对着曲线判断处在什么位置、还差多远。

更关键的结论在趋势外推:如果指数规律成立,5 年内(论文给的区间是 2028 年中到 2031 年中)模型就能独立完成人类现在要花一个月(约 167 工时)的软件任务。这是部署规划和安全治理都要提前考虑的时间窗口。

局限与存疑

作者自己列得很清楚。这些任务都是结构化的软件活,代表不了更乱的真实工作;绝对值可能整体偏差达 10 倍;数据不足以稳定测 95% 这种高成功率门槛。外推 5 年假设指数趋势在真实任务上也成立,这是个没人能保证的假设。

增长靠什么撑起来也值得留意:论文归因于模型更能适应错误、更会用工具、逻辑推理更强。但这些是定性判断,不是因果分解。

术语

原文与代码

社区讨论

相关论文

全部论文解读