Chatbot Arena 的天平是歪的:Meta 发 Llama-4 前私下测了 27 个变体

The Leaderboard Illusion

Shivalika Singh, Yiyang Nan, Alex Wang, Daniel D'Souza, Sayash Kapoor, Ahmet Üstün, Sanmi Koyejo, Yuntian Deng, Shayne Longpre, Noah A. Smith, Beyza Ermis, Marzieh Fadaee, Sara Hooker

cs.AI, cs.CL, cs.LG, stat.ME

2025-04-29

Cohere 团队拆解 Chatbot Arena 的三处扭曲:厂商可发布前私测多版本只公开最优分(Meta 发 Llama-4 前测了 27 个);闭源拿到的对战数据远多于开源(Google 19.2% 对全开源合计 8.9%);243 个公开模型里 205 个被静默下线。

这篇在解决什么

Chatbot Arena 已经成了给 LLM 排名的事实标准:任意用户发一条 prompt,给两个匿名模型的回答投票,平台用 Bradley-Terry 模型把两两胜负折算成胜率分数。它影响媒体、影响融资、影响采购,赌注极大。问题是这个擂台到底公不平等。作者团队(Cohere Labs 牵头,普林斯顿、斯坦福、滑铁卢、MIT、AI2、华盛顿大学参与)有少见的视角:一部分作者给 Arena 提交过 Cohere 的模型,又靠长期抓取加上部分私有测试渠道,看到了公众看不到的匿名变体。他们要回答的就是榜单规则是不是系统性地偏袒了少数玩家。

方法

这是一篇审计型论文,「方法」就是他们怎么把扭曲挖出来。几路证据拼在一起:一是 2025 年 1 到 3 月抓取的 Arena 快照,同时覆盖公开模型和匿名私有变体;二是让匿名模型自报身份来归因到厂商(近似手段,作者公开了代号供同行纠错);三是从公开统计估出战量占比和采样率;四是受控训练实验,在 0% 到 70% 的 Arena 数据上微调,再看 ArenaHard 胜率;五是把模型下线情况和 FastChat 后端官方标注的废弃名单对比。他们引用 Goodhart 定律作纲:一个指标一旦成了被追逐的目标,就会被钻空子。

结果

第一处扭曲:私有测试加选择性披露。少数厂商(Meta、Google、OpenAI、Amazon)能在发布前把大量变体放上去私测,可以撤回成绩、只公开最优的那一个。Meta 在 Llama-4 发布前的一个月里私测了 27 个变体。模拟显示,从 N 个变体里挑最高分,会系统性地抬高 Arena 评分。而且公开榜单上跑的版本,未必和公开 API 一致。

第二处扭曲:数据获取严重不对称。按总战量占比估,Google 约 19.2%、OpenAI 约 20.4%,41 个完全开源的模型加起来才约 8.9%,61.4% 的数据流向闭源厂商。采样上闭源模型被多采、开源和开权重模型被少采,也更常被移除。

第三处扭曲:拿 Arena 数据确实能涨分。把训练用的 Arena 数据从 0% 加到 70%,ArenaHard 胜率从 23.5% 翻到 49.9%,相对提升最高到 112%。这还是保守估计,因为部分厂商能拿到的私有 API 数据比这多五到十倍。

第四处扭曲:下线会破坏排名。243 个公开模型里,205 个被静默下线,而 FastChat 后端官方只标了 47 个废弃。静默下线的模型里 64% 是开权重或完全开源。静默下线会让对战图丢掉连通性,动摇 Bradley-Terry 的前提,留在榜上的分数因此变得不可靠。

作者给了一套可操作的改革建议:禁止提交后撤回成绩;对每家厂商的私有变体数设硬上限;给出可审计的下线标准(按闭源、开权重、开源分层,各自淘汰排名收敛后的后 30%);真正部署他们自己论文里提过的主动采样规则;按季度公开被测、被下线、被采样的模型明细。

为什么重要

对从业者:别把 Arena 排名当成模型真实能力的 ground truth,尤其在拿一个刚发布的闭源模型去比一个较老的开源模型时。排名里混进了「对 Arena 分布的过拟合」和「数据获取特权」,不全靠本事。对整个领域,这是一份测量学层面的警告,而建议便宜可行。要补一句公平话:Arena 是组织者和开源社区费力搭起来的有价值平台,作者的诉求是改革,不是推倒。

局限与存疑

作者自陈的局限不少。他们看不到 Arena 的原始数据(平台会去重、清可疑投票、移除私有对战),所以无法研究对抗性投票。抓取快照只覆盖 1 到 3 月,又恰逢 Llama-4 发布,所以 Meta 的计数可能偏高、其他厂商被低估。训练实验用的是真实厂商手里数据的一小部分,过拟合的真实程度多半被低估。厂商归因靠模型自报,有误差。再补一条作者没强调的:112% 和翻倍的提升,是在 Arena 数据上训练、在 ArenaHard(Arena 分布的测试集)上测的,所以它部分量的就是「拟合 Arena 分布」,这恰恰是作者的论点,但这个幅度不该读成通用能力的涨幅;部分结论绑定在 1 到 3 月这个窗口上。

术语

原文与代码

社区讨论

相关论文

全部论文解读