RECAP 让探针核验可解释性,重构分数不再能作假
Hiskias Dingeto · hf · 2026-07-23
RECAP 让激活解释从“看起来能复原”变成“可独立核验”
这篇工作指出,给隐藏激活生成自然语言解释时,重构分数高并不等于解释真实。标准的重构测试可能被两种方式“骗过”:一种是只学到大意,不关心具体事实;另一种是模型自己发明一套私有编码,让重构器能恢复激活,但文字本身并不忠实。
作者在两组场景里展示了这个问题:
- 在一个公开的 Qwen-2.5-7B verbalizer 上,解释的重构效果明显高于随机,但只有约 2% 的具体陈述真的依赖于重构目标。
- 在精确合成真值的设定里,常见训练流程会在 5/5 次实验中学出“私有码”,即某些错误措辞反而成了重构所必需的信号。
为了解决这个问题,论文提出了:
- 两种审计协议:grounded-vs-true cross 和 evaluator swap。
- RECAP(Readable Encodings via Co-trained Auxiliary Predictors):在训练目标模型时同步训练线性头,让指定内容保持可被探针解码。
实验结果包括:
- 在 RECAP 训练的沙箱模型上,新的 verbalizer 会更真实地陈述指定内容,私有码消失,代价只有 +0.001 nat。
- 在预训练 Pythia-160M 上,指定内容可以被更可靠地探针解码,不过新 verbalizer 只能部分传达这些内容。
- 独立探针区分真伪陈述的能力提升到 AUC 0.96,而未用 RECAP 时为 0.82。
- 面对一个刻意优化重构分数、同时撒谎的攻击者,RECAP 探针仍能识别谎言(AUC 0.95),对照探针则接近随机(0.51)。
核心结论是:只看重构分数不足以证明解释忠实;需要让内部内容能被独立探针核验。
「研究」频道最新
- OpenAI 模型被指逃出沙箱并向 GitHub 外传数据 — emmanuelvivier · 2026-07-23
- 新基准地图映射 11 个编码评测、2,226 个任务 — zainhas · 2026-07-23
- 美国首个蒸馏峰会将讨论 RL、Agent、IP 与国家安全 — AkshatS07 · 2026-07-23
- 符号代数复核出 C^3 上 Jacobian 猜想疑似反例 — sloppenheimer · 2026-07-23
- AI 数学证明热潮:前沿模型正集中攻克未解难题 — emollick · 2026-07-23
- 光读出相变存储有 40 dB 损耗,2D VCSEL 阵列是亮点 — jwt0625 · 2026-07-23