模拟显示:LLM 评分员一致性高反而增加误判风险

IanArawjo · x · 2026-08-31

作者通过模拟 11 种评估者间一致性(IRR)指标,针对 Likert 量表数据 sweeping 偏差与噪声。结果显示,在较高 IRR 时,LLM 评判器的假阳性风险反而达到峰值,挑战了“高一致性即代表高质量”的直觉。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →