研究:跨语言 SAE 特征复现会高估迁移效果,23 种语言下仅 1 个特征真正有效
ravithejads · x · 2026-09-08
被 BlackboxNLP 2026 Special Track 接收的论文,在 Gemma 2 与 Gemma 3 上因果验证多语言稀疏自编码器(SAE)翻译特征:
- 复现 Wu et al. 的 SAE 特征发现方法并扩展到多变 prompt 语言/源语言/目标语言的设定
- 两个模型中均发现:可找到 20 多个在所有发现设定下频繁激活的特征,但因果验证(放大/消融激活)显示其中绝大多数效应微弱或不一致——特征「复现(recurrence)」会高估跨语言迁移
- 例外:Gemma 2 的 (L10, 5717) 与 Gemma 3 的 (L20, 2456) 一个特征,在 23 种语言设定下放大均提升 COMET 分、消融均降低,是一个语言无关的翻译启动方向
对可解释性研究者是重要的方法论警示:仅靠激活频率筛选特征不可靠,必须做因果验证。
「研究」频道最新
- 数学家用 Astra 70 分钟证出一周未解的渐近式,赞其远胜 Sol — arampell · 2026-09-08
- Google 发布 AlphaGenome Atlas:90 亿个 DNA 变异的零代码查询平台 — GoogleAI · 2026-09-08
- Kimi K2 Horizon 嵌入 Uno 离散扩散,速度超 EAGLE-3 — HongyiWang10 · 2026-09-08
- ECCV 2026 SLAM 工作坊论文合集上线 — ducha_aiki · 2026-09-08
- TerraSky3D 空地多视角数据集发布:150 个场景 5 万张图,已登陆 Hugging Face — ducha_aiki · 2026-09-08
- EPO v1.2 位姿精化提速 2.4 倍,4090 上达 318 it/s — ducha_aiki · 2026-09-08