该协议在两类任务阻断p-hack迁移超72%

krisgligoric · x · 2026-07-06

研究在两个“真实效应为零”的任务上评估该协议,因此任何显著结果都属p-hack。测试覆盖20个模型、4家提供商、11种配置,协议在两个任务中分别阻断了73.9%和72.7%的p-hack迁移。

所属事件:研究提出LLM预注册协议以遏制评测p-hacking(7 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →