Arena 新增事实性排行榜

WeijiaShi2 · x · 2026-07-16

Arena 把 factuality 纳入了模型排名,新的榜单会按“人类偏好 + 事实性”的加权结果展示。

官方说明他们会随机抽取对话中的 battle,提取可由网页核实的断言,再逐条核验正确性;为此已经标注了超过 200 万条 LLM 断言,其中 130 万+ 来自 Text Arena,70 万 来自 Search Arena。

转推里提到的结果是:GPT-5.6 在事实性上明显领先,Grok-4.5 紧随其后;Opus-4.8 的事实性分数高于 Fable-5,而 Muse-Spark 在事实性权重提高后掉分明显。

所属事件:Arena 将事实性纳入模型排行榜(12 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →