SAE特征可语言化随层数增强

Sauers_ · x · 2026-07-14

这条转推讨论了 jlens 如何用于描述 SAE 特征,并指出它大体上是在把“运动神经元”之类的高相关特征用语言说出来。

作者通过比较 jlens 生成的特征描述 与 Neuronpedia 提供的标签 的一致性,观察到这种“可语言化”的能力会随着层数增加而提升;在 Qwen3-4b 中,大约在 第 22 层附近出现明显变化。原推还提到,在原始 Jacobian 结果里也能看到类似趋势:后面的 Jacobian 增益更高。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →