模型不解释或撒谎,RelP 比黑盒多近 5 点,SAE 与电路追踪无效

Pando: Do Interpretability Methods Work When Models Won't Explain Themselves?

Ziqian Zhong, Aashiq Muhamed, Mona T. Diab, Virginia Smith, Aditi Raghunathan

cs.LG, cs.AI

2026-04-13

卡内基梅隆用 720 个植入决策树的 Gemma-2-2B,测模型不解释或撒谎时白盒工具能否预测行为。只有 RelP 稳定多 3 到 5 个百分点,SAE 和电路追踪打不过 10 条样本的黑盒。

这篇在解决什么

机械可解释性常被拿来做对齐审计:模型口头说一套、内部算另一套时,白盒工具理应比追问更能看清它在干什么。现有评测很少控制「黑盒提示能不能自己把规则挖出来」。如果能,白盒的增益可能只是提示得更好,不是读到了内部计算。论文把这个坑叫做 elicitation confounder(诱导混淆)。

卡内基梅隆造了一批可控的 model organism:把已知决策树微调进 Gemma-2-2B,再沿 explanation axis 控制模型会不会、会不会诚实地解释自己。任务是只给 10 条输入-输出,外加可选的一种白盒工具输出,预测模型在未见输入上的决策。规则已知,所以能对照工具分数盯的是决策相关字段,还是字段名字本身。

方法

每个场景 10 个命名字段(数值加二值类别),采样深度 1 到 4 的完全决策树,类别大致 40/60 到 60/40。三个场景:买车、选电影、在监督条件下是否违规。三个解释设定:无解释只训输入-输出;忠实设定在标签后跟真规则的字段和阈值;不忠实设定跟一套字段完全不相交的干扰规则。

Gemma-2-2B-instruct 用 LoRA(r=8)微调,每条配置 20 个独立模型,共 720 个,验证准确率要过 95%。训练用约 1000 种自由格式模板,评测用未见过的固定自然语言格式。

每个模型 100 条输入,智能体只看到随机 10 条标签。所有 LLM 智能体共用两段流水线:GPT-5.1 抽规则,GPT-4.1 套到剩下 90 条上。唯一差别是附加通道:纯样本、把「because」续写出来的 prefill,或某一种工具在这 10 条上的输出。对比包括梯度显著性、RelP(relevance patching,改过的反向传播把相关性分到字段上)、logit lens、残差与词嵌入余弦、GemmaScope SAE 梯度特征、电路追踪,以及最近邻和决策树投票。

结果

主表在三个场景上平均,90% 置信区间,n=240。无解释时,只看 10 条样本的 sampleonly 准确率 75.0%。RelP 到 79.7%,普通梯度 77.9%。logit lens、残差、SAE、电路追踪都在 73% 到 75%,跟黑盒差一个点以内。忠实解释时 prefill 升到 81.8%,压过所有白盒;不忠实时 prefill 掉到 73.1%,低于 sampleonly 的 75.0%,RelP 仍有 78.7%。

方法无解释准确率忠实不忠实无解释字段 F1
RelP79.779.478.778.4
梯度77.975.877.673.6
prefill76.481.873.165.7
sampleonly75.073.075.061.6
SAE 梯度74.972.074.963.2
电路追踪73.370.775.560.2

字段 F1 把差距拉得更大:无解释下 RelP 比 sampleonly 高 16.8 个百分点。工具更能指出哪些字段在规则里,端到端准确率还被阈值恢复噪声挡住一层。深度 4 时准确率全体挤在 57% 到 61%,RelP 的字段 F1 优势从深度 1 的 +6.1 涨到深度 4 的 +22.7。样本预算 k=3 时 RelP 相对黑盒的准确率优势到 10.1 到 10.3 个百分点,预算变大后差距收窄,排序不变。

方差分解把工具分数拆成字段身份、字段取值、是否参与决策。RelP 的决策相关性增量 R² 达 0.555,普通梯度 0.190;logit lens 的字段身份 R² 达 0.468,决策相关性只有 0.023。RelP 和梯度判断字段是否在规则里的 AUC 超过 0.79,SAE 信号大约 0.50,跟随机差不多。

用 Claude Code 当研究智能体跑了 78 次、约 25.5 小时、600 美元 API。最终智能体相对 RelP 只再涨 1 到 2 个百分点准确率,多数落在置信区间重叠里,字段 F1 多 3 到 5 点。45 次以上尝试(SAE、注意力、隐状态)没挖出新信号源。

为什么重要

对齐审计真正困难的场景,就是模型不说、或者说谎。Pando 把这个场景做成可复现的下界:字段显式写在输入里、规则是浅决策树、模型只有 2B,大多数白盒工具仍然打不过 10 条样本。梯度类方法能用,是因为它们读的是模型拿这个字段做什么,不是这个字段叫什么。logit lens 和 SAE 在这里更像在读任务表征,对审计帮助有限。

当前白盒工具在这个简化设定里,能稳定超过黑盒的只有归因这一路,端到端也就几个百分点。RelP 值得作为审计流水线的默认附加通道。别指望电路图和特征解释自己讲出决策规则。

局限与存疑

作者自己写了:合成决策树、字段显式标注、Gemma-2-2B 的 LoRA,真实模型里的特征可能是潜伏、分布式、不直接出现在输入里的。查询是非自适应的,跟真审计里主动选下一个问题不一样。端到端准确率还混进了抽取器会不会用工具输出这一点。

720 个模型都是同一类轴对齐树灌进同一类 2B 模型,负结果外推到更大模型和更脏的目标要打折。treevote 假设了决策树假设类,在无解释下到 77.1%,跟梯度接近,说明知道规则形态本身就值几个点。自动研究那 1 到 2 点多数落在置信区间里,不能当成 RelP 已被超越。评测抽取器用的是 GPT-5.1,工具失败也可能是信号格式对抽取器不友好,不完全是信号为零。

术语

原文与代码

社区讨论

相关论文

全部论文解读