研究警示:缺乏人工校验的LLM评委存在高假阳性率

近期,研究者Ian Arawjo通过多项模拟研究对当前流行的“LLM作为评委”评估方法提出严厉质疑。研究指出,如果在使用LLM裁判时缺乏人工校验或未做校正,各类偏差会导致极高的假阳性率,这意味着许多看似显著的评测结论实际上可能是假的,这一发现值得AI评测社区高度警惕。

核心发现与风险

研究团队在数千种数据分布上进行了模拟。结果显示,当LLM裁判存在偏置时,假阳性率会显著升高。Ian Arawjo特别强调,如果只用LLM给缺失的人类数据打分,其结果和直接使用有偏的LLM裁判一样糟糕,依然会显著放大假阳性率。因此,未经人工验证的LLM裁判结果绝对不能直接轻信。

一致性指标的假象

针对如何衡量LLM裁判的可靠性,Ian Arawjo指出Cohen's kappa等一致性指标可能会高估LLM评审与人类的一致性。他解释称,这类一致性统计指标对随机分歧更为敏感,而对稳定的系统性偏移(例如LLM总是比人工评分高或低1分)则不那么敏感。因此,即使kappa看起来很高(例如达到0.85),也未必说明LLM裁判的结论真正值得信任。

后续验证与扩展

目前,该模拟研究正在进一步扩展以检验更多变量。Ian Arawjo表示,他们正尝试按一致率拆分结果,目的在于观察诸如kappa=0.85这样的具体一致性指标是否真正足以让人信任LLM裁判的结论。

2026-07-19 ~ 2026-07-21 · 7 条相关

一手来源