实测警示:7 个 LLM 评审集成高一致性反而产出假阳性结果

IanArawjo · x · 2026-09-07

IanArawjo 分享一次实测教训:用 7 个 LLM 评审集成来预测人类评分,得到了看似很棒的高评分者间一致性(IRR),却产出了完全虚假的「超显著」结果。他强调,「对齐度高的 LLM 评审假阳性更高」在抽象层面好理解,但在实际数据集上踩坑是另一回事。

所属事件:实测警示:多 LLM 评审高一致性或放大系统性偏见(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →