A Lie Detector Test for Language Models: Reading Knowledge a Model Won't Reveal
Hiskias Dingeto
cs.AI
2026-09-19
PIR用选项对比从残差流读出模型认准的答案,八个模型上平衡准确率0.70到0.87;提示欺骗和sandbagging仍可读,RMU遗忘后掉到未知题基线。
能力评测默认模型会认真答。它可以故意答差(sandbagging),也可以按提示说假话。卸载危险知识时,也分不清知识是没了,还是只是嘴上不说。行为上看,两种情况都是错答案。
已有线性探针能从激活里读出真假,但多半要带标签的真值语料,有的还要另训一个诚实模型。这篇要的是:不靠外部真值、不靠对照诚实模型,直接读出模型认哪一个选项是对的,并据此把「不肯说」和「不会」切开。
方法叫 PIR(Probe of Internal Recognition),类比测谎里的隐蔽信息测验(Concealed Information Test):把真细节混在诱饵里,看对熟悉项的反应更强。
流程如下。把选择题和全部选项送给模型,在每个选项最后一个 token 的残差流上取向量。在模型诚实答对的题上,用「正确选项 span 减去干扰项平均」得到识别方向。新题上,把各选项投影到这个方向,分数最高的就是模型认准的答案。层用题目不相交的交叉验证选,拟合和测试不共用同一题。
无标签时,对各题选项中心化后取第一主成分,方向接近有监督版。激活里有少数极大维度的模型(如 Gemma-3)要先按维标准化,否则点积会被撑爆。
部署时没有标准答案,就改成散度检测器:用该模型改动前的基座、在诚实条件下标定方向,算「识别分最高的选项」减「模型实际输出的选项」。分大说明认的是 A、说的是 B。conceal 对 unknown 的划分用 AUC。「知道」的操作定义很严:基座模型把选项轮转一圈都答对,才算知道,用来去掉位置偏差和蒙对。conceal 是知道却答错;unknown 是本来就不会。
自由生成没有选项列表,就从引出条件和部署条件下的采样里重建候选,再套同一套 span 读取。这时改用峰值识别分做检测。
主模型是 gemma-2-9b 指令版,复现覆盖 Gemma、Qwen、Llama、Mistral、Phi 共八个模型。数据是 MMLU、WMDP 三域、ARC-Challenge,自由生成用 TriviaQA。
提示欺骗下,识别平衡准确率 0.70 到 0.87,未知题基线 0.28 到 0.40,四选一随机约 0.25。Gemma-3 原始点积只有 0.389,标准化后到 0.735。
| 设置 | 识别准确率 | 未知题基线 |
| 训练 sandbagging(MMLU,藏着的题) | 0.85 | 0.30 |
| 自然主义 sandbagger(藏着的子集) | 0.63(全集已知题 0.81) | 0.34 |
| 外部密码锁 | 0.93 | 约 0.30 |
| 外部 circuit-broken | 0.90 | 约 0.30 |
| 自跑 RMU(gemma-2-9b) | 0.39 | 0.35 |
| 外部 Qwen2.5-7B RMU / NPO(生物) | 0.36 / 0.38 | 0.35 |
RMU 只卸网络安全时,该域掉到 0.34(基线 0.42),生物从 0.91 到 0.68,化学从 0.76 到 0.51,遗忘是分域的。外部 checkpoint 有过遗忘。
因果检验:把识别方向加到错误选项的 token 上,gemma-2-9b 选中该选项的概率 0.189,对照 150 个随机方向是 0.005;加选项字母的输出方向则是 0.000,两方向余弦 0.01。phi-4 上转向概率 0.122。
检测 AUC(conceal 对 unknown):训练前缀机体内部 0.718,对文本 0.517、黑盒行为 0.645。密码锁内部 0.892、黑盒 0.845、合并 0.929。circuit-broken 内部 0.848、黑盒 0.860、合并 0.899。模型若用低置信度错答来藏,黑盒已经能看见;自信地藏时内部信号更值钱。
TriviaQA 上,诚实模型在同时产出对错候选的题上解码 0.71,机会率 0.42,纯文本 0.54,self-consistency 0.56。训练后的自由生成 sandbagger 解码 0.74,峰值识别 AUC 0.776。无标签主成分方向在 MMLU 上 0.812,对有监督 0.825。跨数据集几乎不掉:WMDP 上拟合的方向在 MMLU 上 0.815、ARC 上 0.900。
对抗方面,把识别间隔压到零的 anti-probe 机体,在题目不相交交叉验证下把监测打到未知基线,触发能力仍 0.71。作者撤回了「固定方向能扛过攻击」的旧结论,那是样本内伪迹。
评测和卸载都缺一个行为给不了的信号:模型内部还认不认得这道题。PIR 给出一个可操作的边界:能被提示、密码、触发器找回的能力,识别分仍高;RMU、NPO 这类推理时找不回的卸载,识别分掉到「从来不会」的水平。circuit-breaking 在引出上看像卸掉了,PIR 仍能读到,说明抑制输出不等于擦记忆。
审计场景清楚:有基座 checkpoint 的发布审核、卸载验收。它不是黑盒 API 的工具。对没被专门训练来躲探针的模型,这是可用的白盒审计信号。
必须有候选答案,覆盖选择题和能重建候选的短事实问答,覆盖不了没有可枚举答案的开放推理。部署检测器需要该模型自己的基座或诚实 checkpoint。白盒对手可以训练机体把识别间隔抹掉。读数沉默时,分不清是卸掉了还是从来没有。conceal 和 unknown 标签来自严格的轮转门,丢掉答得不稳的题,检测数字被这道门塑过形。干净的分域卸载只来自一次自跑 RMU;外部 checkpoint 过遗忘。若干机体单种子;自由生成检测只在一个模型和事实题上展示。转向实验说明方向被使用,方差匹配的消融没能证明它必要。作者不声称权重永远学不回来。