MLP 神经元为何按输出类别分工?残余流写入方向给出解释
aryaman2020 · x · 2026-09-05
aryaman2020 继续讨论电路可解释性:每个 MLP 神经元都向 residual stream 的固定方向写入(post-norm 架构除外)。对一个覆盖单一任务的数据集,只要模型需要为不同实例输出不同的词,就必须征用写入不同输出 logits 的组件。
由于 MLP 占了模型大部分参数、必然参与其中,即使是单一任务,模型也不得不为不同输出类别征用不同的 MLP 神经元。他提到自己的工作中观察到后期单神经元为不同州名写出不同方向,并引用 Sheridan Feucht 关于 modular addition 的近期论文,展示 MLP 神经元如何'铺排'数轴。
所属事件:电路可解释性撞墙:消融跨任务误伤,特异性存疑(4 条相关)→
「研究」频道最新
- Typst 写论文可直接上传 arXiv,作者称比 LaTeX 省心得多 — zouharvi · 2026-09-06
- 全球首例:AI 实时辅助切除脑肿瘤,48 岁患者视力得以保住 — alex_verem · 2026-09-06
- 15个前沿LLM医疗测试:对抗压力下94%正确答案失效 — davidmanheim · 2026-09-06
- 哈佛论文惊悚命名:大语言模型是「认知病毒」 — mikeflache · 2026-09-06
- 实测推翻论文数据:DiffusionGemma 峰值吞吐实为 3k tok/s,约为论文 3 倍 — bodonoghue85 · 2026-09-06
- Google Astra 复查论文复现代码,揪出顶级期刊重大错误 — soumitrashukla9 · 2026-09-06