Entropy Distribution as a Fingerprint for Hallucinations in Generative Models
Mattia J. Villani, Pranav Deshpande, Akshay Seshadri, Romina Yalovetzky, Niraj Kumar
cs.AI
2026-05-27
JPMorgan 把幻觉检测写成对参考熵 CDF 的假设检验。校准熵分 CES 一次前向、只要 logits,在 80 组实验里进入多样本方法的第一梯队。
用熵抓幻觉并不新,但现成做法几乎都把一条生成压成一个数:perplexity、长度归一化熵、生成长度。多样本方法更准,要跑至少几次前向;白盒探针要隐状态。JPMorganChase 全球技术应用研究中心这组人的主张更细:幻觉会改 token 熵的分布形状和尾巴,不只改均值。扣掉均值之后,形状差异在 80 组模型–数据集实验里仍然全部显著。
先用一个「幻觉定义 oracle」(人,或 GPT-4.1-nano 裁判)在校准集上留下非幻觉样本,把这些样本的 token 熵池化成参考 CDF F̂₀。新生成的熵序列如果不像从这个 CDF 抽出来,就判幻觉。CES 取两个标量:序列平均熵和最大熵,各自送进 F̂₀,再做几何平均。分数落在 [0,1],跨模型跨任务不用重调阈值。没有标签时,他们用全部校准样本估 CDF;幻觉比例 γ 不大时,KS 距离的污染上界是 ε+γ。
理论侧把 DKW 不等式推到随机长度向量,给 F̂₀ 的一致收敛;再证明在均值和上尾都偏移的备择下,CES 的真阳性趋向 1、假阳性指数下降。关键假设是:给定长度,非幻觉 token 熵近似 i.i.d.。附录用滞后 1 自相关检查,只是近似成立。
十个模型(Falcon-7B、Llama-2/3/3.2、Mistral-7B、GPT-4.1 系列、GPT-4o-mini)乘八个问答集(BioASQ、CoQA、DROP、GSM8K、NQ-Open、SQuAD、SVAMP、TriviaQA),每格 500 条、最大 128 或 256 新 token。幻觉率中位数 0.27,从 0.04(TriviaQA、CoQA)到 0.78(SVAMP、NQ-Open)。
80 组里 72 组的双样本 KS 在 α=0.05 显著,中位 dKS=0.100,中位 Cohen's d=0.192。把序列中心化去掉均值后,80/80 的形状差异仍显著。无监督 CES 对 16 个基线的 1279 次两两比较赢 854 次(66.8%),对 12/16 个方法胜率过半。对生成长度 +0.085 AUROC(85% 胜率),对 SelfCheckGPT +0.034(80%),对语义熵 72.2% 胜率。它输给 KLE 全家和 Embedding Regression(43.8%,Δ=−0.017)。Friedman 检验 χ²=272.80;无监督 CES 平均秩 6.29,落在最佳秩 6.16 的临界差 2.779 之内,和 KLE、语义熵、Eigenscore 统计上分不开,计算却少得多。无监督变体对监督 CES 的两两胜率是 78.8%。
只要黑盒 logits、一次前向,就能摸到接近多样本语义方法的检测力,还带有限样本校准保证。生产上可以离线造参考 CDF,在线只算均值和最大值。幻觉定义交给校准 oracle,检测器本身不绑死某一种事实标准。
AUROC 是全样本内排序,校准 CDF 和评测共用这 500 条,没有独立测试划分,数字偏乐观。条件 i.i.d. 并不严格成立。生成短于约 10 个 token 时分布检验没力量。若模型被错误数据训到「一本正经地错」,F₀ 和 F₁ 的 KS 距离可以是 0,任何熵检验都会失效。实验是贪心解码加短问答;随机解码和长文开放生成还没做。部分 API 不给 top-k logits。裁判质量封顶检测上限。无监督变体反而常赢监督,也说明标签和协议仍不稳。