Arena 增加事实性排名
Kyrannio · x · 2026-07-17
Arena 介绍了一个新的模型排名维度:factuality(事实性)。
- 现有排名不再只看人类偏好,而是把 human preference 与 factuality 组合成一个加权指标;这个新视图在 Text Arena 和 Search Arena 中以非默认开关形式提供。
- 他们的做法是随机抽取 battle,提取模型回答里的 可被网页验证的 claims,再逐条核验正确性,比较不同模型的平均正确率。
- 为了支撑这套排名,Arena 已经给 超过 200 万条 LLM 声明做了标注,其中包括 130 万+ Text Arena 和 70 万+ Search Arena 的声明。
- 相关视频还解释了这套方法如何从 Bradley-Terry 目标扩展到同时考虑偏好与事实性,以及为什么模型在“拒答/不做断言”时不应被简单惩罚。
所属事件:Arena 将事实性纳入模型排行榜(12 条相关)→
「研究」频道最新
- researchers 辩论双向注意力:检索微调放大后因果性或可舍弃 — antoine_chaffin · 2026-09-11
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11