LLM 评判没有人工验证不可靠
IanArawjo · x · 2026-07-19
作者指出:如果只用 LLM 给缺失的人类数据打分,结果和直接用有偏的 LLM judge 一样糟,依然会显著放大假阳性率。 他们在大量数据分布上做了模拟,发现**未做校正的 LLM 判断很容易给出“看似显著、其实是假的结果”**。相反,把 **4 个经过 PPI 校正的统计检验** 平均起来,即使只依赖少量人类标签,也能保持较好的假阳性控制。结论很直接:**没有人类验证的 LLM judge 结果不可信**。
所属事件:研究称缺乏人工校验的LLM评委假阳性率极高(7 条相关)→
「研究」频道最新
- AI 研究者:数学模型早就擅长穷举式找反例 — dyamins · 2026-07-21
- 本周必读 AI 论文:智能体、长上下文 RL 和机器人策略 — TheTuringPost · 2026-07-21
- AI 工具正在改写形式化数学的反例发现 — burny_tech · 2026-07-21
- 可解释性研究的实证软肋:缺乏基线对比与显著性检验 — burny_tech · 2026-07-21
- Generative Bionics 人形机器人六个月走到可行走平台 — CyberRobooo · 2026-07-21
- 免疫基础模型 MAESTRO 试图预测未来免疫轨迹 — arjunrajlab · 2026-07-21