Caltech团队提出SAE-FNO,NeurIPS 2026论文用函数表示概念
AnimaAnandkumar · x · 2026-10-06
Anima Anandkumar 团队论文《Mechanistic Interpretability with Sparse Autoencoder Neural Operators》被 NeurIPS 2026 接收。
- 问题:标准稀疏自编码器(SAE)用标量激活表示每个概念,无法捕捉概念在时空结构中的表达位置与方式。
- 方法:提出 SAE 神经算子(SAE-NO),基于傅里叶神经算子(FNO),把概念参数化为函数而非标量,将数据视为底层连续函数的样本,在函数空间之间学习映射。
- 双重稀疏:概念稀疏性选择哪些概念激活,域稀疏性决定概念在空间域上的表达位置;分离了结构与表达能力。
- 意义:改变稀疏设置可能改变可发现的概念乃至科学结论,该框架为结构化数据的机制可解释性研究提供了新工具。
arXiv 编号 2509.03738,作者 Bahareh Tolooshams、Ailsa Shen、Anima Anandkumar。
「研究」频道最新
- COLM 论文:潜空间推理模型的潜 token 多数可解码,可解释性即正确性信号 — sarahwiegreffe · 2026-10-07
- Apple ML 招聘研究实习生:让基础模型「知道自己知道什么」 — sineadwilliamso · 2026-10-07
- CAVEAT 测试台登场:商店促销能否带偏你的 AI 购物 Agent — ZacharyHuang12 · 2026-10-07
- GEA:以群体为进化单元的 Agent 自我改进范式,SWE-bench 71% — xwang_lk · 2026-10-07
- 9B 模型花 25 美元算力微调,达 Jev 决策指数 79% 分数 — sophiamyang · 2026-10-07
- 机器人学会「恢复技能」,真机任务成功率从 77.5% 升至 87.5% — qinzytech · 2026-10-07