There Is No Neutral Harness: Modern LLM Leaderboards Are Manufactured by Config-Fragile Items
V. S. Raghu Parupudi
cs.AI
2026-07-17
12个开源模型在26种同样站得住的评测配置下重答3679道选择题。相邻模型在双方都答稳的题上打平,差距平均95.7%由会翻转的题贡献。
MMLU、ARC这类选择题把题目和标准答案定死了,但没定选项顺序、提示怎么写、答案是从生成文本里解析还是从选项似然里取。已有工作把这种敏感度记成总分方差,当噪声压下去。那回答不了两个问题:方差落在哪些题上?这些题是不是正好把一个模型和下一个模型分开的那些?
如果噪声均匀摊在整张卷子上,排名还站得住。如果噪声刚好砸在拉开名次的题上,排行榜打印出来的顺序就是配置造出来的。
把评测harness当成自变量,效果拆到单题。仪器是fragility grid:12个指令微调开源模型,来自Qwen3、Llama 3、Gemma 4、Mixtral四家,3B到70B,在完全相同的3679道四选题上、26种配置下各答一遍。题目来自ARC、HellaSwag、MMLU和TruthfulQA,每题四选一。解码全程greedy、零样本,权重和题目不动,只动harness。
三个轴:选项顺序(原序加五种固定打乱,共6种)、提示格式(字母加点、括号字母、数字标签、显式要字母,加上两种与顺序无关的cloze似然,格式轴共6种)、计分方式(生成解析 vs 长度归一化的选项似然)。生成格式×顺序得到24种,再加2种似然cloze,共26种。参考配置是字母标签、原序、生成计分。没有一种是为了整模型而设计的。
一道题对某个模型:26种全对叫robust-correct,全错叫robust-wrong,对错过叫config-fragile。相邻模型的分差可以拆成双方都答稳的部分,和会翻转的部分。
同一组权重、同一组题,分数是一条带子。gemma4-31b参考分88.0%,最低配置30.6%,最高88.6%,跨度58.0个百分点。摘要里写的31%到89%就是这条带子。12个模型平均85%的「参考分答对」能被另一种同样站得住的配置翻成错。任何模型的robust准确率最高只有21.5%,五个模型低于7%。最不稳的是榜首gemma4-31b,不是弱模型。
相邻11对里,双方都答稳的题上:5对逐题完全一致,4对只差1题,剩下2对两边互有对错、净差为零。10对在全量题上有分差的,全部是manufactured:全量有序,稳健集上打平。分差平均95.7%由脆弱题承担,按题池加总是99.7%。gemma4-12b对qwen3-14b在26种配置里有21种名次对调。参考序和其他配置的Kendall相关平均0.42,典型配置会翻掉约29%的成对名次。
冠军是配置选出来的。4个模型至少在一种配置下拿到第一,8个进过前三。gemma4-31b拿下16种,中位领先181.5题;qwen3-14b拿下8种,中位领先98.5题。后两个冠军各赢一种,分别只多1题和3题。mixtral-8x7b在参考配置排第11,在似然计分下能排第一。字母标签对数字标签、同一题干同一顺序,六种选项排列下冠军都会换人。
压缩基准会把脆弱题留下来。题目区分度与脆弱性相关0.28(95% CI 0.25–0.30)。区分度最高的100题平均脆弱性0.96,全卷是0.85。压到100题后,随机子集的冠军数从4升到5.1,按区分度选再升到平均5.7。
三个轴里,计分最伤:固定其余轴为参考时,顺序轴保住60%的得分,提示格式40%,生成对似然只剩31%。三轴一起只剩11%。协议里最常被钉死的选项顺序,恰恰是最不重要的那一轴。
读排行榜的人如果只看一个数字,看的是模型和harness的混合物。相邻名次在双方都答稳的题上并不存在。从业者至少该做四件事:分数报成带子并附robust准确率;两模型比较先看共同稳健题;harness全文公开,计分方式放第一位;压缩基准先查跨配置稳定性。
论文没有说这些模型能力一样,也没有说选择题没有信号。它说的是:单harness打出来的相邻顺序,不能由模型答得稳的那些题支撑。
只覆盖3B到70B的开源指令模型和四选一。没有闭源前沿模型,没有开放生成、代码或Agent任务。TruthfulQA被改成四选一后,金答案在原序里总在第一位,作者去掉它后冠军数从4降到3,主结论仍在。稳健集每对只有72到336题,打平是小样本陈述,不是证明两模型在这些题上能力相等。解码无采样,所以测的是harness方差本身够不够造出顺序,没有和采样方差比大小。似然轴只有两种cloze实现,不能外推到所有likelihood实现。