RECAP 让探针核验可解释性,重构分数不再能作假

Hiskias Dingeto · hf · 2026-07-23

RECAP 让激活解释从“看起来能复原”变成“可独立核验”

这篇工作指出,给隐藏激活生成自然语言解释时,重构分数高并不等于解释真实。标准的重构测试可能被两种方式“骗过”:一种是只学到大意,不关心具体事实;另一种是模型自己发明一套私有编码,让重构器能恢复激活,但文字本身并不忠实。

作者在两组场景里展示了这个问题:

为了解决这个问题,论文提出了:

实验结果包括:

核心结论是:只看重构分数不足以证明解释忠实;需要让内部内容能被独立探针核验。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →