研究者称高评测一致性反而危险,LLM 评估指标遭质疑
Ian Arawjo 发文质疑业界常用的 LLM 评测方法。他指出,指南建议在 LLM-as-Judge 评测员之间检查评估者间一致性(IRR),并认为一致性高即代表质量合格,但这一结论完全错误。他还补充称,这一谬误同样适用于 OpenAI Evals 等业界指南推荐的 Spearman's rho、Krippendorff's alpha 和 Kappa 等常用统计指标,这些指标可能带来误导性结论。
2026-08-25 ~ 2026-08-25 · 2 条相关
- 高评测一致性反而更危险?LLM 评估指标遭质疑 — IanArawjo · 2026-08-25
- 常用评测指标 Spearman/Kappa 同样存误导性 — IanArawjo · 2026-08-25