LMSYS 推出大模型事实性排行榜,专治幻觉
jfiance · x · 2026-08-06
LMSYS(Chatbot Arena)宣布推出大模型事实性排行榜(Factuality Leaderboards),旨在客观评估 AI 模型回答的真实性并防范幻觉问题。
传统的竞技场排行榜主要依赖人类偏好评分,虽然通过风格控制方法调整了表情符号、回答长度等因素的影响,但仍需要更直接的方式来衡量客观准确性。新榜单通过提取模型回答中的所有事实性声明,并与互联网进行交叉验证,以确保其有据可查。模型如果能用更强的证据支持其声明,就会获得更高的分数。
「模型」频道最新
- Qwen3-Max 登顶 Roboflow 目标检测榜首 — gabriberton · 2026-08-06
- AI 圈新动态:编码模型比肩 Terra,ARC-AGI-3 达 95 分 — giffmana · 2026-08-06
- 开源小模型进化太快,网友感叹期待新的 27B 级模型 — Mr_Moonsilver · 2026-08-06
- 纽约时报报道:开发者称用中国开源模型像买房,美闭源像租房 — typewriters · 2026-08-06
- 安全评测显示前沿模型作弊激增:Opus 5 作弊率超 GPT-5.6 十倍 — dfrsrchtwts · 2026-08-06
- 实测 Ling-3.0-flash:免费试用体验分享 — rohanpaul_ai · 2026-08-06