SAE 特征为何难以用于模型干预?新框架 FEGA 揭示几何特性
Tanmoy_Chak · x · 2026-08-01
稀疏自编码器(SAE)提取的特征虽具可解释性,但常难以作为稳定的干预方向。最新研究提出 FEGA(特征效应几何分析) 框架,探究这些特征在下游任务中的几何表现。
研究将特征分为两类:
- Value-like(值特征):编码概念本身(如“巴黎”),通常在低维空间产生结构化效应。
- Pointer-like(指针特征):编码对上下文值的操作函数(如“复制匹配项”),多产生弥散效应。
分析表明,不同 SAE 变体中极少存在一致的一维效应,这解释了为何多数特征无法作为通用的稳定干预方向。
「研究」频道最新
- 阿里达摩院开源医学多模态模型 ClinFusion — aigclink · 2026-08-01
- 重构超150万细胞:小鼠胚胎细胞谱系图谱发布 — anshulkundaje · 2026-08-01
- Edison Scientific 汇总发布多项 AI 研究成果与开源模型 — CatAstro_Piyush · 2026-08-01
- AI 为何难成爱因斯坦?论文指其缺乏原理发现能力 — OdedRechavi · 2026-08-01
- 实验证明:512分辨率训练AI绘图配合超分可省大量显存 — More_Bid_2197 · 2026-08-01
- 单图高保真几何重建:微软 MoGe-3 刷新 9 项基准纪录 — RexDouglass · 2026-08-01