Arena断言统计数据公布
arena · x · 2026-07-16
Arena 解释了他们如何统计模型断言,以及这些断言在对战中的分布情况。
- 他们已经标注了 200万+ 条 LLM 真实对话里的断言:Text Arena 130万+,Search Arena 70万+。
- 这些数据覆盖约 13万 场 Text Arena 对战和 4万 场 Search Arena 对战。
- 在 Text Arena 中,至少一方出现断言的比例是 76%;在 Search Arena 里是 88%。
- 平均来看,Text Arena 每个回复约 5 个断言,Search Arena 里接近 10 个。
- 文中还提到,Text Arena 的边际真实断言率为 87%,Search Arena 为 89%,这与 Arena 的 AutoModality 分类器有关,它会把更可能需要联网的提示自动路由到 Search Arena。
所属事件:Arena 将事实性纳入模型排行榜(12 条相关)→
「模型」频道最新
- 曝 Meta Muse Agent 内置邀请码逻辑,或携额外免费额度上线 — testingcatalog · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- ChatGPT 竟劝用户「问题太复杂,去试试更笨的回答」 — phido3000 · 2026-09-11
- Anthropic 调整年龄验证,Claude 不再向未成年人开放 — Muhammad523 · 2026-09-11
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11