研究称 LLM 评判需与人类一致性达 50% 才有效
近期讨论指出,大模型作为评判工具要想在统计功效上带来实际收益,其与人类标签的一致性需达到约 0.50 以上。经过 PPI 校正等统计检验发现,只有当 LLM judge 与人类标注具备足够高的对齐度时,才能在偏差校正后赢过纯人类标注的检验效果,否则不值得被广泛采用。
2026-07-27 ~ 2026-07-27 · 3 条相关
- LLM judge 需与人类一致性超 50% 才有统计收益 — IanArawjo · 2026-07-27
- LLM judge 与人类一致性约 0.50 才值得报告 — IanArawjo · 2026-07-27
- PPI 校正检验要赢过纯人类标注,先得有足够对齐度 — IanArawjo · 2026-07-27