实测警示:多 LLM 评审高一致性或放大系统性偏见
IanArawjo 分享一次实测教训:用 7 个 LLM 评审集成预测人类评分时,虽然得到看似优秀的评分者间一致性(IRR),却产出了完全虚假的「超显著」结果。他解释称,由于底层模型相关,各评审的偏见呈正相关,系统性偏见被放大;在 IRR 很高、噪声更少时,这种偏见反而更易被误当真。
2026-09-07 ~ 2026-09-07 · 2 条相关
- 实测警示:7 个 LLM 评审集成高一致性反而产出假阳性结果 — IanArawjo · 2026-09-07
- LLM 评审集成偏差机制假说:模型相关性放大系统性偏见 — IanArawjo · 2026-09-07