LMSYS 推出大模型事实性排行榜,专治幻觉

jfiance · x · 2026-08-06

LMSYS(Chatbot Arena)宣布推出大模型事实性排行榜(Factuality Leaderboards),旨在客观评估 AI 模型回答的真实性并防范幻觉问题。

传统的竞技场排行榜主要依赖人类偏好评分,虽然通过风格控制方法调整了表情符号、回答长度等因素的影响,但仍需要更直接的方式来衡量客观准确性。新榜单通过提取模型回答中的所有事实性声明,并与互联网进行交叉验证,以确保其有据可查。模型如果能用更强的证据支持其声明,就会获得更高的分数。

所属事件:LMSYS推出大模型事实性排行榜(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →