用 Barlow Twins 去相关,序列推荐的精度与长尾曝光成了一个旋钮

A Redundancy Reduction Approach for Controllable Sequential Recommendations

Veronika Ivanova, Marina Munkhoeva, Ivan Razvorotnev, Evgeny Frolov

cs.IR

2026-09-21

给序列推荐加 Barlow Twins 去相关项,正样本对取下一物品相同的两条历史;五个基准精度全涨,α 旋钮可在头部与长尾间重分配曝光。

这篇在解决什么

序列推荐天然长尾:少数热门物品吃掉大多数曝光,模型又反过来强化这个集中,因为高频物品收到更多梯度更新,表征往用户历史的共享方向靠,拿到一个与具体用户无关的全局打分优势。从业者经常要在「列表头部准」和「长尾有曝光」之间做工程折中,但缺少一个能在训练期连续调节这个折中的手段。Yandex 与 HSE 的团队把问题转成表征几何问题,工具是自监督学习里的 Barlow Twins 目标。

方法

训练目标 L = Lpred + α·LBT。Lpred 是普通的下一物品预测损失,LBT 是 Barlow Twins 冗余削减损失:两个视图的嵌入先做 ℓ2 归一化和均值中心化(代替原版的投影头),再算交叉相关矩阵,对角元推向 1,非对角元推向 0。

正样本对的取法是这篇最干净的地方:不做掩码、裁剪、重排这类合成扰动,直接配对「下一个目标物品相同」的两条用户历史。语义上说得通,通向同一物品的历史本该有相近表征,而且标签天然一致。

几何分析给出机制:把物品表征分解到用户嵌入均值所在的共享方向上,高频物品在这个方向分量大,得分里多出一项与用户无关的加分;去相关把用户表征的均值推向零、协方差推向单位阵,抹掉这个低秩方向,热门物品的全局优势随之消失。论文还定义了 Alignment Concentration 指标,按流行度分桶度量物品对共享子空间的对齐集中度,用来量化这个效应。

结果

五个公开基准,三种基础损失(BCE、CE、SCE),加 BT 后全部上涨。ML-1M 配 CE 时,NDCG@10 从 0.0494 到 0.0583。对全部基线(SASRec 各变体、CL4SRec、DuoRec、EC4SRec、两阶段 BT 预训练)的相对提升:

数据集HR@1NDCG@10cov@10
ML-1M+12.7%+6.2%-12.5%
Yelp+8.9%+2.7%+9.5%
Gowalla+4.6%+5.7%+7.6%
Beauty+6.9%+4.8%-6.2%
Kindle+5.8%+4.1%+13.9%

(相对第二名)

精度端没有争议:几乎全部数据集全部指标显著(配对 t 检验 p<0.05)。曝光端分数据集:Yelp、Gowalla、Kindle 的目录覆盖上升,ML-1M 和 Beauty 反而下降。

分桶看,ML-1M 上 HR@1 在头部桶略低于基线,中尾桶明显更高;到 HR@10 连头部都追平,热门物品的精度没有为长尾买单。α 就是那个旋钮:Yelp 上把 α 从 0.1 加到 0.4,HR@10 基本不变、覆盖上升;ML-1M 方向相反,α 大了精度和覆盖一起掉,作者归因于该数据集时间戳碰撞,大量「同下一物品」的配对被高频终点物品主导。实用建议 α 取 0.2 到 0.4。

为什么重要

两个可以直接拿走的东西。一是给任意 dot product 序列推荐器加一行的训练期正则:不换架构、不加推理成本,精度稳定上涨,这个可以直接上。二是 α 提供了一个部署后仍可调的曝光分配手段,对有生态多样性要求的平台(内容分发、电商长尾供给)来说,比事后重排更根本。两阶段 BT-PT 的对比还说明端到端联合训练优于先预训练再微调。

局限与存疑

头部与尾部的效应强依赖数据集,ML-1M 和 Beauty 覆盖不升反降,时间结构在其中怎么起作用只有归因没有验证;几何变化与曝光变化之间的因果链,作者自己承认没建立;没有与专门的流行度去偏方法对比,作者把这框定为另一个问题设定;正样本对构造在时间戳密集的数据上会被高频终点物品带偏。另外五个基准都是传统序列推荐规模,没碰 LLM 系推荐器。

术语

原文与代码

社区讨论

相关论文

全部论文解读