电路可解释性撞墙:消融跨任务误伤,特异性存疑

一篇入选 COLM 2026 Sci-FM Workshop 口头报告的电路可解释性研究带来负面发现:为解释模型行为提取的「电路」未通过特异性检验,消融操作会跨任务误伤。aryaman2020 解析称组件级电路特异性低并不意外,因为 layer 0 MLP 几乎在所有任务上归因极高;而神经元级特异性更高,可由 MLP 神经元向 residual stream 固定方向写入解释。相关讨论还引用 Usha Bhalla 等人关于 SAE 能否捕捉概念流形的新论文,提出「稀释」失败机制。

2026-09-05 ~ 2026-09-05 · 4 条相关