可解释性工具也会「选择性失明」:微调后的激活预言机反成概念盲点
QMUL · hf · 2026-08-10
Activation Oracles (AOs) 是一种通过训练来读取和回答其他模型内部激活状态的语言模型,常用于提取隐藏信息。然而,AOs 本身也是学习系统,其输出受训练数据和目标影响。
研究人员在受控的“Taboo Word Guessing”环境中测试发现,经过微调的 AOs 并不会成为特定概念的专家读取器,反而会变成概念特定的反读者:它们会持续性地无法恢复训练期间一直存在的概念。
分析表明,这种失败并非因为主体模型或 Oracle 表示中缺失该概念(目标信息依然可解码),而是出现在 AO 的读取路径上。这表明行为泄漏、表示级可解码性和 AO 可语言化能力可能会脱节,对这类学习型可解释性接口的可靠性提出了挑战。
「研究」频道最新
- Hugging Face 长文:2026 前沿模型的强化学习后训练演进史 — SergioPaniego · 2026-08-10
- 清华揭示硬提示压缩致命缺陷:指代悬垂致准确率骤降 — Tsinghua · 2026-08-10
- 科普:掩码扩散是连续扩散的离散类比 — alec_helbling · 2026-08-10
- Nathan Lambert 发布 RLHF 教科书:深入解析大模型后训练 — Interconnects (Nathan Lambert) · 2026-08-10
- 机制可解释性研究员 Neel Nanda 分享入门 LLM 研究指南 — NeelNanda5 · 2026-08-10
- 实测用4B/8B模型替换MiniMax H3的32B文本编码器 — Fit_Ad7343 · 2026-08-10