Are Sparse Autoencoders Useful? A Case Study in Sparse Probing
Subhash Kantamneni, Joshua Engels, Senthooran Rajamanoharan, Max Tegmark, Neel Nanda
cs.LG, cs.AI
2025-02-24
在113个探测任务与四种困难设置下,SAE探针加入工具箱后平均打不过逻辑回归;数据集错误等发现用普通基线也能复现。
稀疏自编码器(SAE)把语言模型的隐藏状态拆成一批尽量单义的特征,是近两年机械可解释性里最常用的工具之一。麻烦在于没有 ground truth:没人能指出模型内部真正在用的概念清单。社区只好拿重建损失、下游交叉熵这类代理指标给 SAE 打分,而这些指标跟「能不能帮人理解或控制模型」并不对齐。
正面个例很少,而且多半只深挖一个场景、基线参差。负面结果同样稀:Chaudhary 发现 SAE latent 拆地理知识还不如神经元。MIT Tegmark 组与 Neel Nanda 把问题换成一个更硬、更好对照的下游任务:用 LLM 激活训练线性探针。探针本身就有用处,安全检测、知识定位、睡眠代理识别都靠它。如果 SAE 真抽出了概念级特征,那在数据少、类别偏、标签脏、分布偏的时候,这组特征应该给出有用的归纳偏置。这篇就是去测这个假设。
主实验用 Gemma-2-9B,附录用 Llama-3.1-8B 复现核心结论。SAE 分别来自 Gemma Scope 的 JumpReLU 和 Llama Scope 的 TopK。探测对象是 113 个二分类数据集,从「这条标题是不是头版」到「这句话是不是蕴含」,提示最短 5 个 token,最长左截断到 1024。探针打在指定层最后一枚 token 上,评估用 AUC,不依赖分类阈值。
SAE 探针不在整段 latent 上做回归。先按两类训练样本的平均激活差,挑出差距最大的 k 个 latent(k=16 或 128),再对这组坐标做 L1 正则逻辑回归。基线是普通激活上的逻辑回归、PCA 回归、KNN、XGBoost 和 MLP,每种搜 10 组超参。
评价方法叫 Quiver of Arrows:模拟真实使用者,按验证集 AUC 从一篮子方法里挑最好的,再报测试集 AUC。要回答的是,把它加进工具箱之后,最佳方法有没有变强。赢某一个弱基线不算数。标签噪声和协变量偏移时验证集不可信,就改成 SAE 探针与逻辑回归头对头。
四种困难设置分别扫开:训练样本数在 2 到 1024 之间取 20 个对数间隔点;正类比例从 5% 扫到 95%;标签翻转比例从 0 扫到 50%;再加 8 个 OOD 集,包括换语言、换句法、以及 GLUE-X 的极端语法与蕴含版。
标准条件(最多 1024 条、类别平衡)下,基线在 Gemma-2-9B 的第 20 层最好,后续实验锁在这一层。SAE 宽度几乎不影响探针,更大的 L0(平均激活特征数)和更大的 k 更强。最终固定测 width=16k/131k/1M 的最大 L0,k 取 16 和 128。
这一篮子 SAE 探针在 113 个任务里被 quiver 选中 14 个,加进去之后整体测试 AUC 略降。数据稀缺、类别不平衡、标签噪声三条平均曲线上,各参数点都看不到稳定优势。SAE 不是没被选中:每个设置最多有大约 40 个数据集选了它,选了也赢不过。协变量偏移上,逻辑回归更稳。
一个具体失败很说明问题。任务 66 要判断英文句子里有没有 "living room",对应 latent 在分布内 AUC 0.99,把句子译成法语后掉到 0.64,对法语词完全不激活。用 o1 按 autointerp 描述剪掉可疑 latent,两个任务的 OOD AUC 只回升 0.024 和 0.052,分布内到分布外的落差远大于这点回升。虚假相关不是主因,latent 本身不跨分布。
可解释性侧,SAE 一开始看起来能抓到 CoLA 的错标,以及「AI 生成 vs 人类」文本末尾标点的虚假相关。三模型多数票认为 CoLA 大约 25% 的标签有问题,高于原论文人工一致性实验里 13% 的分歧率。但把逻辑回归打到 Pile 上找最大激活 token,同样能看到这些模式。
先前 Anthropic 的 Features-as-Classifiers 报告 SAE 探针略胜。这篇指出一个对照陷阱:对方用跨 token 的 max-pool SAE,基线却把激活也按维度做 max-pool,而激活没有特权维度。换成 last-token 对照,max-pool SAE 在 60 个随机任务上胜率从 2.2% 升到 19.6%;再给基线加上 attention-pooled 探针,用 quiver 选策略,SAE 胜率掉到 8.7%。八种 SAE 架构从 2023 年原始 ReLU 排到 2024 年底 Matryoshka,探测性能只有不显著的轻微上扬。
| 对照 | SAE 相对表现 |
| 标准条件 quiver | 14/113 任务选中,整体略降 |
| 稀缺 / 不平衡 / 噪声 | 各参数平均无提升 |
| 8 个协变量偏移集 | 逻辑回归更好 |
| max-pool SAE vs last-token 基线 | 胜率 19.6% |
| 加上 attention-pooled 基线 | 胜率 8.7% |
SAE 的训练指标在涨,架构在换,但换到一个有强基线的下游任务上,概念级归纳偏置没有变成可测量的优势。对要上探针的人,默认用正则逻辑回归就够;想做可解释分析,先把同样的功夫花在基线上。Neuronpedia 那套 autointerp 是便利,不是证据。电路定位、去偏那些正面个例还在,只是它们大多只讲了一个例子。
作者自己承认,探针表现只是 SAE 效用的代理。即便「真正的」模型特征基,对线性探针的归纳偏置也可能本来就弱。他们建议去棋类这类有已知特征的玩具模型上再测。
Gallifant 等人后来在安全相关数据上,用多 token、二值化、全维度 SAE 探针打过基线,但对照仍是单 token 探针。这篇在附录里试了二值化,没有明显帮助。主实验只打最后一枚 token,对跨 token 分布的概念可能不公平;补了 pooled 对照之后结论没翻。
另一处要打折:113 个数据集是作者为别的目的收集后筛剩的,任务分布不是随机抽样。第 20 层是基线最强的层,SAE 是否在别的层有优势,主文没有系统扫完。