研究提出LLM预注册协议以遏制评测p-hacking
随着LLM被广泛用作标注工具或评测裁判,科研中的p-hacking(数据挖掘式统计操纵)问题变得愈发严重,而端到端自主AI科学家的普及进一步放大了这一风险。为应对此问题,JHU的Maria Thomas与CMU的Nihar Shah合作发布了一项研究,提出专为LLM研究设计的预注册模板与防p-hack协议,旨在推动该领域采用更严格的科学方法并提升可重复性。
协议机制与关键细节
该研究提出的核心协议要求研究者预先注册分析方案与一组“合格模型”,随后在预注册完成后发布的第一个合格LLM上运行确认实验。由于该模型在研究者做出承诺时尚不存在,因此从机制上规避了针对性“刷榜”或操纵评测的可能。此外,研究团队还发布了专为基于LLM研究设计的预注册模板,以避免事后解读偏差和数据集泄漏等问题。
防护效果与代价
在两个“真实效应为零”的任务上(即任何显著结果都属p-hack),该协议测试覆盖了20个模型、4家提供商和11种配置,成功阻断了73.9%和72.7%的p-hack迁移。研究团队自身的预注册实验也显示,85.7%曾对前代模型p-hack的配置在使用下一个合格模型时被成功阻止。该协议保留了检测真实效应的能力,其主要代价是需要等待下一个模型发布,中位等待时间约为10天。
2026-07-06 ~ 2026-07-06 · 7 条相关
一手来源
- 提出预注册分析+合格模型集防评测p-hack — krisgligoric ·
- 该协议在两类任务阻断p-hack迁移超72% — krisgligoric ·
- 研究发布LLM实验预注册模板,推动科学可重复性标准 — krisgligoric ·
- LLM 让科研 p-hacking 更严重 — krisgligoric · 2026-07-06
- 【源头】提出预注册分析+合格模型集防评测p-hack — krisgligoric · 2026-07-06
- 【源头】该协议在两类任务阻断p-hack迁移超72% — krisgligoric · 2026-07-06
- 自测预注册实验85.7%曾p-hack配置被阻止 — krisgligoric · 2026-07-06
- 防p-hack协议保留检测力但需等约10天 — krisgligoric · 2026-07-06
- 自主AI科学家加剧p-hacking风险 — krisgligoric · 2026-07-06
- 【源头】研究发布LLM实验预注册模板,推动科学可重复性标准 — krisgligoric · 2026-07-06