Arena榜单加入事实性

CSProfKGD · x · 2026-07-16

Arena 宣布其文本与搜索榜单开始采用人类偏好 + 事实性的混合排名,并把事实性做成可切换的非默认选项。

他们通过随机抽取对战样本、提取可由网页验证的主张,再逐条核验来评估模型回答的正确性。为支撑这套排名,Arena 已标注了 200 万+ 条现实对话中的模型主张,其中包括 130 万+ 条来自 Text Arena、70 万+ 条来自 Search Arena。

帖子还提到,启用事实性后,一些模型的排名变化明显:OpenAI 的模型整体受影响较小,Grok 因强调真实与客观而提升,Anthropic 和 Google 的结果则较为混合;Meta 的 Muse Spark 和 Dola Seed 下降较多,但 Muse Spark 1.1 仍优于 1.0 和 Llama 系列。

所属事件:Arena 将事实性纳入模型排行榜(12 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →