研究称 LLM 评判需与人类一致性达 50% 才有效

近期讨论指出,大模型作为评判工具要想在统计功效上带来实际收益,其与人类标签的一致性需达到约 0.50 以上。经过 PPI 校正等统计检验发现,只有当 LLM judge 与人类标注具备足够高的对齐度时,才能在偏差校正后赢过纯人类标注的检验效果,否则不值得被广泛采用。

2026-07-27 ~ 2026-07-27 · 3 条相关