Arena推出事实性排名
arena · x · 2026-07-16
Arena 推出一个把人类偏好与事实性加权结合的新模型排名。
- 事实性已在 Text Arena 和 Search Arena 里作为非默认开关上线。
- 他们通过随机抽取对战、提取可用网页验证的断言,再核验这些断言的正确率来计算事实性。
- 为了支撑这套排名,团队已经标注了 200万+ 条 LLM 真实对话中的断言,其中 130万+ 来自 Text Arena、70万+ 来自 Search Arena。
- 开启事实性后,Text Arena 里一些模型名次变化明显:Claude Fable 5 小幅跌至第2,GPT-5.5 上升 13 位到第7,Muse Spark 从第7跌到第20。
- 按厂商看,Meta 的跌幅最大;Anthropic 仍保持整体第1。若只看开源模型厂商,小米提升最大,从第9升到第6。
所属事件:Arena 将事实性纳入模型排行榜(12 条相关)→
「模型」频道最新
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11
- giffmana 补充:环境用于训练正是他要说的重点 — giffmana · 2026-09-11
- 开源 LLM 排行榜与定价对照目录,一站式索引比较工具 — Last_Establishment_1 · 2026-09-11
- Anthropic 称已尽力让评测环境不可被模型识别 — MaxKannen · 2026-09-11
- Nex N2.5 Pro 开源发布,权重体积达 407GB — jinnyjuice · 2026-09-11
- RoMa v2 图像匹配模型发布,作者晒出黑底宣传图 — ducha_aiki · 2026-09-11