实锤数据:Jev 最自信的错误,96% 的 LLM 评委跟着错

deliprao · x · 2026-09-26

Delip Rao 公布关键实验数据:在 Jev 最自信的错误上,96.0% 的 LLM 评委判决重复了同样的错误答案——而如果错误相互独立,理论上应约为 50%。这是对「LLM 评委错误高度相关、集成无法去偏」这一论点的最直接量化证据,属于其关于 Jev 判定模型系列讨论的核心数据点。

所属事件:实验揭示 LLM 评委错误高度相关,级联收益有限(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →