研究者称高评测一致性反而危险,LLM 评估指标遭质疑

Ian Arawjo 发文质疑业界常用的 LLM 评测方法。他指出,指南建议在 LLM-as-Judge 评测员之间检查评估者间一致性(IRR),并认为一致性高即代表质量合格,但这一结论完全错误。他还补充称,这一谬误同样适用于 OpenAI Evals 等业界指南推荐的 Spearman's rho、Krippendorff's alpha 和 Kappa 等常用统计指标,这些指标可能带来误导性结论。

2026-08-25 ~ 2026-08-25 · 2 条相关