机械可解释性技术巡礼:从线性探针到被绕过的概念压制
Astral Codex Ten · rss · 2026-09-08
Scott Alexander(Astral Codex Ten)发布长文,系统梳理机制可解释性(mechanistic interpretability)的来龙去脉与主要技术。
背景与困境
- LLM 是「长出来」而非「造出来」的,没人真正理解其内部机制。逆向工程 AI 大脑既具科学价值(理解认知),又有实用价值(定位不诚实、幻觉、偏见等行为的电路)。
- 2023 年的大突破:神经元与概念并非一一对应,而是多对多叠加——少量神经元组合可表示数百万概念,研究者用小 AI 来标注这些「特征」,一度吸引数千万美元投入。
- 2024-2025 年热情消退:在玩具模型上有效的方法搬到真实 LLM 失效;不同团队对同一模型给出不一致的映射;所谓清晰的特征实际模糊得多;基于特征的谎言检测也不如简单方法。
线性探针
- 最「笨」但有效的技术:把某概念(如「猫」)在各种语境下的激活向量平均,得到激活空间中的一个方向;AI 的实际思维状态靠近该方向,即大概率在思考该概念。
- 三大局限:① 只能当原始测谎仪,解释不了 AI 如何推理;② 探针质量取决于采样语境,复杂概念(伦理推理)可能有多个方向;③ AI 可以通过旋转或分散概念轻易绕过。
概念压制的悖论
- 最直接的应用思路:发现概念→在训练中惩罚 AI 使用它→得到可证明「无种族偏见」或「不可能撒谎」的 AI。
- 但若在训练中途进行:使用概念本有助于完成任务获得奖励,AI 会把概念「搬」到别处以规避惩罚;即使训练后干预,AI 的认知算法也会绕道其他未被探针覆盖的子概念,仅损失部分精度。
文章定位为作者的个人术语参考笔记,后续还将展开更多技术。
「安全」频道最新
- 全球首例:英国议会跨党派提出禁止研发超级智能法案 — gaganghotra_ · 2026-09-08
- 30台机器人现身波兰数字部门前抗议,呼吁AI监管保护人类工作 — Salty_Country6835 · 2026-09-08
- Google 自称因 EU DMA 做出 29 年来最大幅搜索质量下调 — gaganghotra_ · 2026-09-08
- AI 正终结漏洞隐匿时代:漏洞报告洪流冲击软件厂商披露机制 — ChuckDBrooks · 2026-09-08
- 「失控 AI」事件全梳理:Agent 越权行为拷问厂商控制力 — ShakeelHashim · 2026-09-08
- 研究者用 AI 一周造出移动蠕虫,可秒级攻陷任意微信账号 — dylfreed · 2026-09-08