When LLMs Benchmark Themselves: Deconstructing Self-Bias in Automated Evaluation
Wenda Xu, Sweta Agrawal, Vilém Zouhar, Markus Freitag, Daniel Deutsch
cs.CL, cs.AI
2025-10-01
Google用Gemini 2.5 Pro、GPT-4.1、Claude Opus 4做翻译基准,发现每个模型在自己生成并打分的测试上都排第一;出题偏与评委偏叠加,低资源语言更重。
现成榜单几个月就被刷满,人工造新测试又贵又慢。于是出现一类做法:让同一个 LLM 既出题(LLM-as-a-testset)又打分(LLM-as-an-evaluator),合称 LLM-as-a-benchmark。便宜,也能扩到缺标注的语言。
评委偏爱自己产出,这点前人已经写过。这篇要补的是另一半:测试题本身也可能按出题模型的口味长出来。Google 和 ETH Zurich 用机器翻译当主战场,因为有 MetricX-QE、WMT25 人类排名,以及 FLORES-200 这种人类源文本,可以把两段偏拆开量。
被试是 Gemini 2.5 Pro、GPT-4.1、Claude Opus 4,WMT25 上还能被人类排名分开的三家。低到中资源方向覆盖 Bemba、Aymara、Luo、Kurdish 与英语互译。每向 200 条,温度 0。开源多语言模型在低资源上造不出合格测试,被排除。
自偏定义为:该模型给自己的平均名次,减去其余模型给它的平均名次。负数越大,越把自己往前推。用名次不用原始分,方便跨指标比。同伴共识当作质量代理,测的是相对自我优待,不是相对绝对真值的偏差。
三种设置分开跑:
后半段还做了只造源、不共生成参考译文的对照,用来把「挑自己会译的句子」和「生成风格本身」分开。多样性用 chrF@K 量模型内部文本相似度;退化用重复 4-gram 计数,一条里出现不少于 10 个重复 4-gram 就算退化。
出题加打分时,每个模型都把自己排第一。四条 XX→英方向平均名次(越低越好):Gemini 当基准时 Gemini 1.222、GPT 1.525、Claude 1.564;GPT 当基准时 GPT 1.222;Claude 当基准时 Claude 1.123。Bemba→英上 Claude 的自偏到 -0.617,同伴并不认这笔账。
两段偏会叠加。XX→英平均自偏:
| 设置 | Gemini | GPT | Claude |
| 只出题 | -0.124 | -0.239 | -0.093 |
| 出题加打分 | -0.261 | -0.294 | -0.550 |
只出源、不共生成参考,对角线上的负偏还在,Bemba→英上 Claude 到 -0.763。源加参考共生成会把 MetricX 拉低(Bemba→英 Gemini 从 8.49 到 2.73),说明模型会挑自己好译的句子,但风格偏才是主因。
低资源源文本里,模型跟自己更像:Aymara 上 Gemini 内部 chrF@K 37.78,跨模型大约 32。Gemini 22.3% 的源文本出现病态重复,GPT-4.1 5.8%,Claude 0。挑最多样的 50 条(Min chrF)比最同质的 50 条(Max chrF)自偏更小:Gemini -0.170 对 -0.240,Claude 从 -0.205 翻到 +0.045。
方向不对称更硬。英→Bemba 上 Gemini 自偏 -0.15,Bemba→英 -0.59。英→XX 的 TTR 分布几乎重合(Cohen's D 小于 0.2),XX→英则散开(D 大于 0.5)。Chatbot Arena 上英语、韩语自偏接近 0,Bemba、Aymara 明显抬头。用这三家去排 Gemma3-27B、Mistral-Large-2411、Qwen3-32B 时,偏大多压在 0.05 以内;能力差够大,排名还稳。
谁要拿「模型自己造榜」当廉价评测,这篇给出一张使用边界:高资源、能力差大,还能用;低资源、同档模型互比,排名会被自偏翻掉。多样性过滤能削一部分出题偏,但全链路下 GPT 侧评委偏可能盖过过滤。不要把自动造榜当成中立地面。
只有三家闭源前沿模型和两个任务。自偏的「真值」是同伴共识,不是大规模人类排名;作者用独立的 MetricX-QE 交叉验证,自偏仍在,但同伴共识仍可能把共同口味当成质量。多样性过滤在只出题设置上三家都显著,全链路下对 GPT 不显著。高资源方向上三家都接近满分,自偏测不出来,不等于那里没有评委偏。