可解释性研究撞墙:电路消融跨任务误伤,特异性存疑
bearseascape · x · 2026-09-05
作者宣布其电路可解释性论文入选 COLM 2026 Sci-FM Workshop 口头报告,并汇总了新实验进展。
- 核心发现:为解释模型行为而提取的「电路」未通过一项基本检验——消融 A 任务的电路,对 B 任务的伤害与消融 B 自身电路相当,说明电路并非任务特异。
- 旧结论:组件级电路虽然一致(consistent)且因果必要(necessity),却不特异(specific)。作者猜测是超叠加(superposition)导致单个组件承担多个无关角色。
- 新实验:改用更细的归因方法(EAP-IG、RelP),下探到单个 MLP 神经元层级,寻找更稀疏的基底(借鉴 @aryaman2020 等人「神经元本身即可作稀疏基底、无需额外训练」的工作)。
- 新权衡:神经元级电路的特异性确实提升——消融任务自身电路的伤害显著更大;但一致性大幅下降,同一任务不同样本间几乎很少有神经元复现。
这项工作对「电路分析能否真正刻画模型解题机制」提出了根本性质疑。
所属事件:电路可解释性撞墙:消融跨任务误伤,特异性存疑(4 条相关)→
「研究」频道最新
- 15个前沿LLM医疗测试:对抗压力下94%正确答案失效 — davidmanheim · 2026-09-06
- 哈佛论文惊悚命名:大语言模型是「认知病毒」 — mikeflache · 2026-09-06
- 实测推翻论文数据:DiffusionGemma 峰值吞吐实为 3k tok/s,约为论文 3 倍 — bodonoghue85 · 2026-09-06
- Google Astra 复查论文复现代码,揪出顶级期刊重大错误 — soumitrashukla9 · 2026-09-06
- 作者为 HF LLM 推理实现滑窗注意力,实测 32K 上下文 KV 缓存 3.5MB — ahsaor8 · 2026-09-06
- IndianRailwayBench:用抢印度火车票实测各 LLM 真实能力 — Paimaamu · 2026-09-06