可解释性工具也会「选择性失明」:微调后的激活预言机反成概念盲点

QMUL · hf · 2026-08-10

Activation Oracles (AOs) 是一种通过训练来读取和回答其他模型内部激活状态的语言模型,常用于提取隐藏信息。然而,AOs 本身也是学习系统,其输出受训练数据和目标影响。

研究人员在受控的“Taboo Word Guessing”环境中测试发现,经过微调的 AOs 并不会成为特定概念的专家读取器,反而会变成概念特定的反读者:它们会持续性地无法恢复训练期间一直存在的概念。

分析表明,这种失败并非因为主体模型或 Oracle 表示中缺失该概念(目标信息依然可解码),而是出现在 AO 的读取路径上。这表明行为泄漏、表示级可解码性和 AO 可语言化能力可能会脱节,对这类学习型可解释性接口的可靠性提出了挑战。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →