SAE 能否捕捉概念流形?新论文提出「稀释」失败机制
aryaman2020 · x · 2026-09-05
aryaman2020 在与 bearseascape 的电路讨论中,引用了 Usha Bhalla 等人的 arXiv 论文《Do Sparse Autoencoders Capture Concept Manifolds?》,并讨论了「电路的最佳抽象层级是什么」这一开放问题。
- 论文问题:SAE 提取特征时隐含假设概念对应独立的线性方向,但越来越多证据表明概念沿低维流形组织,编码连续几何关系。
- 理论框架:论文回答了 SAE 捕捉流形的含义、何时以及如何捕捉,指出两种模式——全局式(一组原子的线性张成覆盖整个流形)与局部式(特征各自铺贴流形的局部区域)。
- 实证结论:现有 SAE 对连续结构的恢复不理想,两种解混杂成一种「稀释(dilution)」状态,解释了为何单概念层面很少能看到流形结构。
- 讨论部分:aryaman2020 认为若用神经元做电路,理想情况是把极细粒度的神经元分组为写向互补类别的集合,但超叠加等因素可能让这一步做不到,并提到用 Ising 模型类思路处理此问题。
对电路抽象层级之争:作者认同「没有明显最优层级」的判断。
所属事件:电路可解释性撞墙:消融跨任务误伤,特异性存疑(4 条相关)→
「研究」频道最新
- Typst 写论文可直接上传 arXiv,作者称比 LaTeX 省心得多 — zouharvi · 2026-09-06
- 全球首例:AI 实时辅助切除脑肿瘤,48 岁患者视力得以保住 — alex_verem · 2026-09-06
- 15个前沿LLM医疗测试:对抗压力下94%正确答案失效 — davidmanheim · 2026-09-06
- 哈佛论文惊悚命名:大语言模型是「认知病毒」 — mikeflache · 2026-09-06
- 实测推翻论文数据:DiffusionGemma 峰值吞吐实为 3k tok/s,约为论文 3 倍 — bodonoghue85 · 2026-09-06
- Google Astra 复查论文复现代码,揪出顶级期刊重大错误 — soumitrashukla9 · 2026-09-06