实测警示:多 LLM 评审高一致性或放大系统性偏见

IanArawjo 分享一次实测教训:用 7 个 LLM 评审集成预测人类评分时,虽然得到看似优秀的评分者间一致性(IRR),却产出了完全虚假的「超显著」结果。他解释称,由于底层模型相关,各评审的偏见呈正相关,系统性偏见被放大;在 IRR 很高、噪声更少时,这种偏见反而更易被误当真。

2026-09-07 ~ 2026-09-07 · 2 条相关