LMArena 加入事实性排行
the-grand-finale · reddit · 2026-07-16
LMArena 给 Text Arena 和 Search Arena 加入了新的 Factuality 维度,榜单改为 人类偏好 + 事实性 的加权组合,且这是一个可切换的非默认模式。
事实性怎么测
- 随机抽取 Arena 对战样本
- 从模型回答中抽取可由网页验证的断言
- 逐条核验这些断言
- 比较对战双方的平均正确率
团队说,他们已经为此标注了 200 万+ 条模型在真实对话中的断言:
- Text Arena:130 万+
- Search Arena:70 万+
榜单变化
Text Arena:
- Claude Fable 5 从第 1 降到第 2
- GPT-5.5 上升 13 名到第 7
- Muse Spark 从第 7 跌到第 20
Search Arena:
- GPT-5.5-search 升到第 1
- GPT-5.2-search 从第 11 升到第 3
- claude-sonnet-4-6-search、gemini-3.1-pro-grounding 等都有下滑
所属事件:Arena 将事实性纳入模型排行榜(12 条相关)→
「模型」频道最新
- 曝 Meta Muse Agent 内置邀请码逻辑,或携额外免费额度上线 — testingcatalog · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- ChatGPT 竟劝用户「问题太复杂,去试试更笨的回答」 — phido3000 · 2026-09-11
- Anthropic 调整年龄验证,Claude 不再向未成年人开放 — Muhammad523 · 2026-09-11
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11