可解释性研究者解析:为何组件级电路特异性低、神经元级更高
aryaman2020 · x · 2026-09-05
aryaman2020 评析一项电路可解释性研究,给出两点判断:
- 组件级电路特异性低并不意外:他观察到的模型里 layer 0 MLP 几乎在所有任务上都有极高归因(前人称之为 effective embedding);而把整个 MLP block 当作图节点本身就不合理——参数太多,必然什么都在做。
- 引用的原文发现:神经元级消融显示特异性确实提升——消融任务自身电路的伤害远大于消融他人电路,但代价是电路一致性差,同一任务的不同样本间几乎很少有神经元复现。
所属事件:电路可解释性撞墙:消融跨任务误伤,特异性存疑(4 条相关)→
「研究」频道最新
- NEAR AI Lean agent 全解 Putnam Bench,成本仅为次便宜方案的 1/250 — lukaszkaiser · 2026-09-06
- KV缓存原理详解:LLM推理中为何重要且常被误解 — techNmak · 2026-09-06
- AI 用 48 小时写 2 万行 Lean 代码,攻克 98 年未解的数学难题 — 量子位 · 2026-09-06
- 「认知地图作为思维媒介」新文分享 — abenitezburraco · 2026-09-06
- Google 论文数学证明:训练数据缺技能时,推理越长错误越爆炸 — solyarisoftware · 2026-09-06
- 北大与快手 Kling 推出 MAVIN,多镜头音视频生成入 ECCV 2026 Oral — jiqizhixin · 2026-09-06