LLM judge 与人类一致性约 0.50 才值得报告
IanArawjo · x · 2026-07-27
这是一条对同一结论的补充回复,表述更直接:LLM judge 的 IRR 一致性需要大约达到 0.50 以上,经过校正后才会在统计功效上带来收益,而且这个结论在 3 种 IRR 指标下都成立。
帖子进一步强调:如果一致性低于这个水平,研究者应当停止报告 LLM judge 结果,直接回到较少的人类标注样本上做显著性检验。也就是说,judge 不是低一致性时的“免费增益”,而可能只是徒增复杂度。
所属事件:研究称 LLM 评判需与人类一致性达 50% 才有效(3 条相关)→
「研究」频道最新
- 通过清空 AI 记忆测试 anthropics,把睡美人变成工程问题 — jessi_cata · 2026-07-27
- 便宜存储让 SCD Type 2 显得过时,作者主张改用每日快照 — Zachly · 2026-07-27
- Creed-Bench 发布,专测模型的个人上下文能力 — craighepburn · 2026-07-27
- Reddit 追问:Qwen3.6-27B 该用预训练、SFT 还是 RL — No-Paper-557 · 2026-07-27
- 研究者发现模型常要经历 a→b→c→d 才学会算术技巧 — dejavucoder · 2026-07-27
- Claude Code 跑长研究项目离不开人类监督 — _akpiper · 2026-07-27