MLP 神经元为何按输出类别分工?残余流写入方向给出解释

aryaman2020 · x · 2026-09-05

aryaman2020 继续讨论电路可解释性:每个 MLP 神经元都向 residual stream 的固定方向写入(post-norm 架构除外)。对一个覆盖单一任务的数据集,只要模型需要为不同实例输出不同的词,就必须征用写入不同输出 logits 的组件。

由于 MLP 占了模型大部分参数、必然参与其中,即使是单一任务,模型也不得不为不同输出类别征用不同的 MLP 神经元。他提到自己的工作中观察到后期单神经元为不同州名写出不同方向,并引用 Sheridan Feucht 关于 modular addition 的近期论文,展示 MLP 神经元如何'铺排'数轴。

所属事件:电路可解释性撞墙:消融跨任务误伤,特异性存疑(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →