Attention Residuals 可能直接暴露跨层信息流,方便可解释性研究

tokenbender · x · 2026-07-28

这条帖子结合配图里的 AttnRes 论文,提出了一个被忽视的可解释性角度:Attention Residuals 不只是结构创新,也可能直接服务于解释分析。

核心点是,AttnRes 让每一层都有一个学习出来的 pseudo-query,并显式产生“这一层从哪些更早 block 读取了多少信息”的权重矩阵。这样一来,原本需要靠 activation patching、path attribution、causal tracing 等方法反推的跨层信息流,模型在前向里就部分“自己说出来”了。

作者的判断是:如果这个思路成立,可解释性工作会轻松很多,因为你不必再费力重建 residual stream 里是谁贡献了什么,直接看层间读取分布就行。不过他也强调,这只是初步想法,可能还有实现上的细节问题。

所属事件:K3与Attention Residuals推动大模型可解释性(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →