Arena 将事实性纳入模型排行榜

Arena 在 7 月 16 日宣布,把 factuality 正式加入 Text Arena 与 Search Arena 的模型排行,并提供“人类偏好 + 事实性”的加权榜单视图。该功能目前是非默认开关。之所以值得关注,是因为它试图补上“用户更喜欢”不等于“回答更正确”的缺口,把受欢迎程度与可核验正确性放进同一套比较框架。

方法与数据

Arena 介绍,这套 factuality signals 的做法是先随机抽取对战样本,再从回答中提取可由网页验证的断言,随后逐条核验真伪。为支撑这一指标,团队称已标注超过 200 万条来自真实 LLM 对话的断言,其中 Text Arena 超过 130 万条,Search Arena 超过 70 万条;他们还补充公布了断言数量及其在对战中的分布情况。

榜单变化

在 Search Arena 中,开启 factuality 权重后,GPT-5.5-search 升至榜首,GPT-5.2-search 则从第 11 升到第 3。Arena 还提供了可交互的加权图表,方便查看不同事实性权重下各模型分数与名次如何变化。另据 Arena 的观察,随着事实性权重提高,大多数开源模型分数会下降,其中 nvidia-nemotron-3-ultra 下滑尤为明显;mistral-medium-3.5 是其点名的少数例外之一。

背景与意义

Arena 认为,这套指标能够揭示前沿模型之间此前不易看出的差异,也更贴近现实使用中对可靠性的要求。换言之,这次更新不只是新增一个排行榜筛选项,而是在尝试把“模型好不好用”和“模型说得对不对”拆开衡量,再重新组合。

2026-07-16 ~ 2026-07-17 · 12 条相关

一手来源

另有 6 条近重复转述:arena · arena · the-grand-finale · WeijiaShi2 · CSProfKGD · Kyrannio