模拟研究发现,LLM Judge 在无人工验证时假阳性很高

teortaxesTex · x · 2026-07-21

这条讨论强调:没有人类验证的 LLM judge 结果不能直接信。

作者表示,他们在数千种数据分布上做了模拟,发现使用“绝对评分”的 judge 在不同偏差条件下会出现很高的假阳性率。核心结论是:如果评测设定不做校正,看起来“显著”的结果很可能其实是假的;配图也展示了这种误判风险有多大。

所属事件:研究称缺乏人工校验的LLM评委假阳性率极高(7 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →