残差连接才是元凶,causal self-attention 推荐模型为何死磕最后一条交互

Residual Dominance as a Structural Account of Last-Item Reliance in Causal Self-Attention Recommenders

Keito Kozaki, Keigo Sakurai, Ren Togo, Takahiro Ogawa, Miki Haseyama

cs.AI, cs.IR

2026-08-14

北海道大学发现 SASRec 类模型对最近一次交互的极端依赖,根源不在注意力权重,而在残差连接结构性保留同位置信息的倾向。

这篇在解决什么

SASRec 这类用因果自注意力做序列推荐的模型,推荐结果往往严重依赖用户最后一次交互的那个物品。此前的研究已经用扰动实验和排名诊断确认了这个现象存在,但没解释清楚它是怎么在模型内部形成的。如果单纯是注意力权重在起作用,应该看到影响力从最后位置向前平滑衰减,但实测观察到的是断崖式的:只保留最后一个物品、打乱前面所有位置,模型表现几乎不掉;连最后一个物品也打乱,表现才会大跳水。这种不连续性说明,光看注意力权重这一个组件,解释不了模型到底在用什么机制死死抓住最后一条交互。

方法

论文没有停在注意力权重上,而是把整个注意力块(自注意力 + 残差连接 + 层归一化)拆开分析。用一种基于范数分解的方法,把每个位置对最终表征的贡献拆成一个个可测量的分量,定义了一个「混合比率」(mixing ratio):这个值越低,说明某个位置的输出越依赖自己本身的信息(自我保留),越高说明越多吸收了其他位置的上下文信息。

分析分三步进行,依次测量注意力输出本身(Attn)、加上残差之后(+Res)、再经过层归一化之后(+LN)的混合比率。同时用九个覆盖不同稀疏度、序列长度、领域的公开数据集,以及 SASRec、DuoRec、BERT4Rec、GRU4Rec 等多种架构,验证这个发现是不是某个数据集或模型特有的偶然现象。

为了进一步验证残差连接和最后一项依赖之间是不是有实质关联,论文还设计了一个推理时的可控干预:残差缩放(residual scaling)。用一个系数 α 直接调节残差分支在推理时的强度(α=1 是标准设置),不需要重新训练模型,就能看混合比率和最后一项依赖度随 α 的变化是否同步、是否可逆。

结果

指标数值
注意力输出本身的混合比率(9 个数据集平均)0.72-0.96(高,说明注意力确实在聚合上下文)
加上残差连接后的混合比率骤降到 0.12-0.40(自我保留信息占绝对主导)
层归一化的额外影响极小,和加残差后的数值几乎一样
各位置(L、L-1、L-2)混合比率差异(Toys/ML-1M)最大差 0.0032-0.0186,残差主导是全局现象,不是只集中在最后位置

残差缩放实验证实了这套结构解释:α 越小,混合比率越高、HRLI@1(最后一项被排到第一名的比例)越低,两者随 α 单调联动。同时,把 α 从 1 调低到 0.1-0.3 区间时,原本因为最后位置预测出错、但非最后位置的表征已经能把正确答案排进 top 10 的那部分样本,有相当一部分「复活」了,重新被最终预测排进 top 10,这直接说明模型内部确实存有能预测对的信号,只是被残差连接的结构性偏好挡在了最后一步。作者用验证集选 α(而不是直接看测试集调参)重现了同样的准确率-恢复率权衡,证明这个可控性不是过拟合测试集造出来的假象。

为什么重要

对做序列推荐模型的团队,这篇提示了一个此前被忽视的排查方向:模型对最近交互的过度依赖,不一定是训练数据或损失函数的问题,可能就写在残差连接这个再普通不过的架构组件里。想调整推荐结果对「最新一次点击」的敏感度,推理时调残差强度是一个不用重新训练就能尝试的旋钮,虽然论文明确说这只是诊断工具,不是拿来直接部署的新方法。更广一点看,「注意力权重不能代表信息真正被怎么用」这个教训,对所有用因果自注意力做序列建模的场景(不限于推荐)都成立,值得在别处的可解释性分析里留意。

局限与存疑

论文自己说得很清楚:残差主导不是最后一项依赖的唯一成因,因果掩码、位置编码、预测接口设计、训练目标、数据特征这些因素都可能有贡献,这篇只是把残差连接的作用挑出来讲清楚,不是给出完整因果链。分析和干预都只针对 SASRec 这类从「最后位置表征」直接做预测的因果模型,论文明确表示 BERT4Rec 这种从 [MASK] 位置预测的双向模型不适用同一套解释框架,因为 [MASK] 位置的残差输入对应一个虚拟占位符而非真实交互物品,混合比率的含义在那里不成立。HRLI 和恢复率这些诊断指标本身和线上真实效用(比如用户满意度、留存)之间的关系还是未知数,论文把这个明确列为开放问题。

术语

原文与代码

社区讨论

相关论文

全部论文解读