代理在难题上的进步大半是天花板效应,真正的增益只剩 +0.40 logits

CurveShift: Is Agent Progress Scalar? Separating Level from Shape

Hanwen Xing, Pengyun Wang, BingXu Meng, Kumail Alhamoud, Xiang Li, Jicheng Wang, Xin Yu, Xinyang Han, Xiaomin Li, Philip Torr, Yuexing Hao

cs.CL, cs.LG

2026-08-01

用项目反应理论拆开代理进步:难题提升大半是 Rasch 能复现的天花板效应,真效应只剩 +0.40 logits(18%→25%),且只发生在竞赛编程。

这篇在解决什么

近两年评估圈有个流行说法:新一代模型在长程、高难度任务上进步最快,能力前沿正在往难题端迁移。METR 的时间跨度(time horizon)数据被反复引用,用来支撑「代理能独立完成的任务时长在翻倍」这类判断。

这篇要问的是一个测量学问题:这种「难题进步」到底是难度响应曲线本身在变形,还是整体能力抬升时被天花板效应和地板效应衬出来的视觉错觉?把整体能力(level)和曲线形状(shape)混在一起的单一标量分数,回答不了这个问题。

方法

作者借来心理测量学的工具。项目反应理论(IRT) 把「一个模型在一道题上的通过率」建模成模型能力 θ 与题目难度 b 的函数;最简单的 Rasch 模型只差一个标量 θ−b,加一个区分度参数就是 2PL。如果只有能力这一维随时间涨、曲线的「形状」并没有变,那就是 level shift;如果难题上多涨出来的部分是 level 解释不了的,那就是 shape change,统计上叫 差异项目功能(DIF)。

关键的识别难点在脚手架(scaffold)。在 METR、SWE-bench 这类 agentic 基准上,新模型几乎总是配新脚手架一起评测,模型代际和脚手架代际共线。一道难题的增益没法判断是模型带来的还是工具链带来的。

作者用 LiveCodeBench 打破这个混淆:它跑竞赛编程,不挂任何 agentic 脚手架,自带人工标注的难度排序,模型按发布日期可追溯,给出「过时模型 × 外生难度」的干净组合。具体做法是锚定 2PL:先在简单题和中等题上冻住每个模型的能力估计 θ,再把难题的区分度 α 钉死(联合估计会退化),最后估计一个难题的「纪元效应」δ。纪元断点定在 2024 年 9 月 o1-preview 发布。这样 δ 就是从能力、难度、区分度三个混淆通道里都剥离不掉的那部分增益。

结果

METR 数据上,难题重心迁移是标量假象。Table 2 里,后 o1 纪元斜率最快的是 15–60 分钟档(6→37 pp/年)和 4 小时以上档(0.3→21),看起来像难题在追赶。但一个只让能力单维上涨的 Rasch 零模型,同样把最快进步档放在 15–60 分钟。机理很机械:靠近天花板或地板的档位斜率被压扁,中间难度的档位正好踩在 logistic 曲线的陡坡上,于是均匀的能力增长就足以把视觉重心推向难题端。唯一 Rasch 解释不掉的残差,是 4 小时以上那一档。

LiveCodeBench 上确实有一个真实的难题效应活下来。66 个带日期的模型 × 1,055 道题(322 易 / 383 中 / 350 难,通过率 0.83 / 0.45 / 0.18):

区分度假设 αhard难题纪元效应 δ(logits)
0.55(二值化压扁)+1.36
0.83(去偏估计)+0.78
1.00(等区分度,保守头条)+0.40

最保守的 +0.40 logits,题目聚类 95% 置信区间 [+0.16, +0.67],把难题通过率从约 18% 抬到 25%。效应在两个独立竞赛体系上都成立:Codeforces +0.79 [+0.40, +1.14],AtCoder +0.30 [+0.01, +0.59]。但这部分增益由最强的推理模型带动,落在需要短推理的难题上,不是需要长程自主性的任务上。

为什么重要

对从业者,第一层结论是务实的:目前并没有干净证据支持代理正在长程自主任务上取得突破。被反复引用的 METR 迁移一阶近似是测量假象。真正站得住的难题增益有,但范围有限,集中在竞赛编程、短推理、+0.40 logits 量级。

第二层是方法论。多数 agentic 基准把模型和脚手架绑在一起升级,任何一道难题增益既可能记在模型账上,也可能记在工具链账上。这意味着在 SWE-bench 这类基准上看到的进步,不能直接读成模型能力。

局限与存疑

作者自己把结论圈得很窄:干净识别只建立在一个竞赛编程基准上,外推到通用代理任务要打折扣。后 o1 纪元这个二值指标捆绑了推理训练、持续扩缩、测试时算力、代理级测试时缩放四件事,没法拆出谁起的作用。δ 的大小还依赖 αhard 的取值,从 +0.40 到 +1.36 跨度不小,论文选最保守值当头条是诚实的,但也说明效应量本身有不确定性。IRT 还假设能力是一维的,这对竞赛编程或许可行,对异质的代理任务就不一定。

术语

原文与代码

社区讨论

相关论文

全部论文解读