Arena榜单加入事实性
CSProfKGD · x · 2026-07-16
Arena 宣布其文本与搜索榜单开始采用人类偏好 + 事实性的混合排名,并把事实性做成可切换的非默认选项。
他们通过随机抽取对战样本、提取可由网页验证的主张,再逐条核验来评估模型回答的正确性。为支撑这套排名,Arena 已标注了 200 万+ 条现实对话中的模型主张,其中包括 130 万+ 条来自 Text Arena、70 万+ 条来自 Search Arena。
帖子还提到,启用事实性后,一些模型的排名变化明显:OpenAI 的模型整体受影响较小,Grok 因强调真实与客观而提升,Anthropic 和 Google 的结果则较为混合;Meta 的 Muse Spark 和 Dola Seed 下降较多,但 Muse Spark 1.1 仍优于 1.0 和 Llama 系列。
所属事件:Arena 将事实性纳入模型排行榜(12 条相关)→
「模型」频道最新
- 曝 Meta Muse Agent 内置邀请码逻辑,或携额外免费额度上线 — testingcatalog · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- ChatGPT 竟劝用户「问题太复杂,去试试更笨的回答」 — phido3000 · 2026-09-11
- Anthropic 调整年龄验证,Claude 不再向未成年人开放 — Muhammad523 · 2026-09-11
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11