预注册研究称幻觉检测有通用下限但无通用器
k01234n · reddit · 2026-08-04
预注册实验显示:幻觉信号有“通用下限”,但没有通用检测器
作者称自己做了两轮实验,覆盖 10 个模型、29 个内部信号(注意力形状、残差变化、读出几何、置信度等),并且在看数据前就完成了预注册。
- 第一轮:只用几何特征的检测器达到预注册门槛,结果是 18/20。把模型自身置信度加进去也没有提升,等于否定了“置信度能覆盖更多样本”的更强说法。
- 没有“通吃所有模型”的最佳信号:在 18 个有效案例里,12 种不同信号分别胜出,说明最佳特征依赖具体模型和任务。
- 但作者也找到一个通用下限:用固定组合在 9 个模型上校准、再去测第 10 个模型,仍能在 ANLI 上 9/10、TriviaQA 上 10/10 跑赢随机。
- 第二轮扩展到 6 个任务(含 HaluEval-QA):按模型单独校准可做到 10/10 胜过随机。
- 但预注册的固定盲测器只有 6/10,而且 4 个失败样本里信号甚至像是“反着读”,AUROC 低到 0.17。
作者的结论是:这更像是一个能找到“高于随机”的通用拟合框架,而不是一个可直接上线的通用幻觉检测器;而且信号在 nf4、int8、bf16、fp32 间保持稳定,说明它测到的不是纯粹量化噪声。
「研究」频道最新
- 神经符号模型被称可生成高可靠数值求解器 — GaryMarcus · 2026-08-04
- Claude Code 底层剖析:系统 Prompt 占比超 75%,体积激增 — ClaudeCodeLog · 2026-08-04
- 用生产 traces 做自蒸馏,让模型越用越强 — ypatil125 · 2026-08-04
- 阅读清单串起重构经济学、agent skills 和 Google 实践 — rseroter · 2026-08-04
- 做得扎实的负结果博士论文,也该能被答辩 — prajdabre · 2026-08-04
- 论文指出所谓“全错”MATH 数据集漏掉了大量正确答案 — burny_tech · 2026-08-04