电路可解释性撞墙:消融跨任务误伤,特异性存疑
一篇入选 COLM 2026 Sci-FM Workshop 口头报告的电路可解释性研究带来负面发现:为解释模型行为提取的「电路」未通过特异性检验,消融操作会跨任务误伤。aryaman2020 解析称组件级电路特异性低并不意外,因为 layer 0 MLP 几乎在所有任务上归因极高;而神经元级特异性更高,可由 MLP 神经元向 residual stream 固定方向写入解释。相关讨论还引用 Usha Bhalla 等人关于 SAE 能否捕捉概念流形的新论文,提出「稀释」失败机制。
2026-09-05 ~ 2026-09-05 · 4 条相关
- 可解释性研究撞墙:电路消融跨任务误伤,特异性存疑 — bearseascape · 2026-09-05
- 可解释性研究者解析:为何组件级电路特异性低、神经元级更高 — aryaman2020 · 2026-09-05
- MLP 神经元为何按输出类别分工?残余流写入方向给出解释 — aryaman2020 · 2026-09-05
- SAE 能否捕捉概念流形?新论文提出「稀释」失败机制 — aryaman2020 · 2026-09-05