When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation
Mubashara Akhtar, Anka Reuel, Prajna Soni, Sanchit Ahuja, Pawan Sasanka Ammanamanchi, Ruchit Rawal, Vilém Zouhar, Srishti Yadav, Chenxi Whitehouse, Dayeon Ki, Jennifer Mickel, Leshem Choshen, Marek Šuppa, Jan Batzner, Jenny Chim, Jeba Sania, Yanan Long, Hossein A. Rahmani, Christina Knight, Yiyang Nan, Jyoutir Raj, Yu Fan, Shubham Singh, Subramanyam Sahoo, Eliya Habba, Usman Gohar, Siddhesh Pawar, Robert Scholz, Arjun Subramonian, Jingwei Ni, Mykel Kochenderfer, Sanmi Koyejo, Mrinmaya Sachan, Stella Biderman, Zeerak Talat, Avijit Ghosh, Irene Solaiman
ICML 2026
cs.AI
2026-02-19
ICML 这篇给 60 个 LLM 基准建了带不确定度的饱和指数,发现近半已分不出模型高下,藏测试集防不住饱和,专家人工把关的基准更抗老。
MMLU、HumanEval 这类基准是衡量大模型进步的标尺,但顶端的分数越挤越紧。当几个最强模型在同一张卷子上都考 90 分上下,基准就失去了区分度,你很难再说谁更强。学界管这种现象叫「饱和」(saturation)。
问题是,饱和一直缺乏一个公认的操作化定义。它到底意味着模型真的把任务做透了、分数接近天花板,还是仅仅几个模型在统计上分不开?为什么有的基准用几年就糊成一团,有的却能一直拉开差距?社区流传着各种猜测:公开测试集会被背题、多选题容易刷满分、热门基准死得快。但这些说法大多没人系统验证过。这篇 ICML 2026 论文(38 位作者,横跨 ETH、Stanford、Hugging Face 等)想把这些含糊的直觉变成可测量的东西。
作者先把「饱和」和「停滞」(stagnation)拆开。饱和是顶端模型逼近某个经验天花板、彼此分不开;停滞只是统计上分不开,但分数还没贴顶。这个区分重要:前者可能是真把任务征服了,后者纯粹是测量精度不够。
他们提出一个带不确定度的饱和指数 Sindex ∈ [0,1],公式是 exp(−Rnorm²)。Rnorm 衡量的是榜首和第 k 名(默认 k=5)的分数差,除以这个差的标准误。如果分数差比评价噪声还小,指数就趋近 1,说明顶端挤成一团。标准误里用了一个「有效测试集大小」neff = n·α 来给超大基准降权,避免几万题的基准把噪声压到接近零、显得不饱和。按指数大小分五档:很低(<0.01)、低、中、高(0.70.9)、很高(≥0.9)。
样本是 60 个文本类大模型基准,两条路径凑出来:一是 OpenAI、Anthropic、Google、Meta、阿里 2022 年 1 月到 2025 年 11 月发布的技术报告里用过的(翻了 61 份文档、筛出 190 个),二是 Semantic Scholar 上高被引的基准论文。最终这 60 个里 56 个公开、4 个私有,44 个纯英文、16 个多语言,28 个封闭式、31 个开放式,14 个模板化,年龄从 1 个月到 114 个月不等。围绕 14 个属性(可访问性、语言范围、年龄与流行度、任务设计、数据构造与质量)提了六个假设去检验。
60 个基准里有 29 个落到高或很高饱和(Sindex ≥ 0.7),其中 14 个属于很高(≥ 0.9)。将近一半。
把几个常被信奉的「防饱和」做法逐一对照:
| 假设 | 结果 |
| 公开基准比私有基准饱和更快(藏测试集防背题) | 公开(56)和私有(4)饱和分布无显著差异,藏数据没用 |
| 纯英文比多语言饱和更快 | 多语言更年轻(平均 32.9 对 48.9 个月),控制年龄后差异消失 |
| 选择题比开放题饱和更快 | 封闭式和开放式无显著差异(年龄已平衡,p=0.40) |
| 模板化基准更易饱和 | 无显著差异(p=0.10) |
| 越热门(高被引、常进报告)饱和越快 | 控制年龄后被引数与饱和无显著关联(ρ=0.22, p=0.12) |
| 专家或人工把关比众包、纯合成抗饱和 | 同龄比较下专家精修的更低;ARC-AGI、BIG-Bench Hard 暴露很久仍未饱和 |
最稳的两个预测因子是基准年龄和测试集规模:越老饱和越重,测试集越大饱和越轻。饱和比例随年龄从 ≤24 个月的 42.9% 涨到 >60 个月的 54.5%,平均指数 0.51、0.52、0.60 三档爬升(趋势方向一致,但未达常规显著性)。把这些属性一起塞进贝叶斯回归,R²Bayes 到了 0.884 ± 0.012,年龄和测试集规模的贡献最稳。
有记录质量问题的基准(40 个)比没有的(20 个)饱和更重,但它们也更老(平均 51.5 对 30.9 个月,p=0.01)。是质量差导致饱和,还是老基准既被刷透又被挑出毛病,因果扯不清。
这篇最值钱的结论是一个祛魅:想靠藏测试集、改题型、加模板花活来给基准续命,都没用。真能延缓饱和的就两件事,把基准做老练(专家持续对抗式更新),以及把测试集做大、做细。对做评测和选模型的人来说,这意味着别再迷信某个基准上 0.5 分的提升就是进步:如果这个差落在评价噪声里,它什么都不是。论文建议排行榜默认带上置信区间和顶端分数离散度,小于噪声的提升不该算突破。
这也给「基准何时该退役」提供了判据。饱和本身不是坏事,如果基准测的是个明确定义的能力,模型顶到天花板恰恰说明任务被拿下了。坏事的是测量分辨率先崩了:题不够多、不够难,几个模型在噪声里抱团,却让人以为它们一样强。区分这两种饱和,是这篇真正想推动的事。
作者自己列了几条:基准样本反映当下评测习惯,可能过度代表那些被广泛采用的;用的是某时刻的排行榜快照,更新不勤的基准会漏掉饱和动态;饱和指数依赖公开的前沿模型评测数据,而这些数据本身可能不全、被选择性披露。他们还假设基准属性不随时间变,但像标注多样性这类东西发版后还会变。
读下来另有几点存疑。一是私有基准只有 4 个,拿它和 56 个公开基准比「没差异」,样本严重不对等,这个结论底气其实有限。二是 60 个基准、六个假设全是观察性相关,没有因果识别,「专家精修抗饱和」可能是这类基准恰好也更新得勤,而非精修本身起作用。三是不确定度估计只针对准确率类指标,Elo、pass@k、裁判模型打分这些常用形式都得另算方差,论文目前的指数覆盖不到。