高评测一致性反而更危险?LLM 评估指标遭质疑
IanArawjo · x · 2026-08-25
Ian Arawjo 指出,业界指南建议在 LLM 评测员(LLM-as-Judge)之间检查评估者间一致性(IRR),若一致性高则认为质量合格。这一结论是完全错误的。对于许多 IRR 指标(如 Kappa),假阳性风险在高度一致(约 0.9)时实际上是最严重的。
所属事件:研究者称高评测一致性反而危险,LLM 评估指标遭质疑(2 条相关)→
「研究」频道最新
- 前员工爆料:AI训练数据生成被鼓励reward hack — jd_pressman · 2026-08-25
- 用 Extropic 热力学堆栈模拟概率神经网络,验证环境控制能力 — beffjezos · 2026-08-25
- Nature 研究:作者自评能有效预测论文科学影响力 — weijie444 · 2026-08-25
- WAM-Diff2 实现自动驾驶 AI 15 倍并行加速 — jiqizhixin · 2026-08-25
- LLM 写作好需类人心智理论?具身智能或是关键 — joshua_saxe · 2026-08-25
- LLM 隐性评估用户能力并据此调整答案复杂度 — rohanpaul_ai · 2026-08-25