简单成对转移在Amazon基准上反超eSASRec达百分之三十八

Do Sequential Recommendation Benchmarks Really Require Higher-Order Sequence Modelling?

Aleksandr V. Petrov, Praveen Chandar, Paul N. Bennett, Hugues Bouchard, Mounia Lalmas

cs.IR

2026-08-20

两个不含高阶序列表示的近因加权成对探针,在eSASRec协议下于三个Amazon集上以15%到38%超过复现的eSASRec,MovieLens-20M上落后27.3%。多数常用基准测不出Transformer多出来的容量。

这篇在解决什么

序列推荐越来越像语言模型:Transformer编码器、生成式检索,号称在抓高阶、上下文相关的交互。基准分数涨了,并不等于这些基准真需要那份容量。分数也可能来自流行度、一阶转移和近因。

更早的神经推荐复现研究里,18个方法只站住7个,其中6个还常被简单启发式打过。序列这边有人打乱历史看顺序是否有信号。这篇问的是另一刀:即便顺序有用,是不是只要「历史里每个物品各自提供一对转移证据」就够了,并不需要P(下一项|物品B且物品C)这种不可分的联合项。

方法

探针故意不学高阶序列表示。先放三个只看最后一次点击的对照:经验马尔可夫链MC、SASRec式的分解马尔可夫FMC、以及全目录softmax版FMC+。然后两个历史感知探针:

每个数据集取SeqRules和PCTM里更好的那个,称为成对包络。Transformer若越不过这条包络,这个基准就提供不了「高阶建模在涨分」的证据。

评测完全跟eSASRec发布的数据切分、全目录排序、过滤已见物品、不用采样负例。SAS+(sampled-softmax SASRec)和eSASRec都按同一协议复现,十个模型-数据集对上与原论文NDCG差不超过0.0033。

结果

全目录NDCG@10:

数据FMC+SAS+eSASSeqRulesPCTM
Beauty.0531.0537.0524.0605.0635
Sports.0271.0315.0324.0371.0368
Toys.0588.0575.0533.0730.0738
ML-1M.1206.1662.1739.1505.1815
ML-20M.1034.1806.1969.1115.1431

成对包络相对eSASRec:Beauty +21.2%,Sports +14.5%,Toys +38.5%,ML-1M +4.4%,ML-20M −27.3%。Amazon上FMC+已经贴近甚至超过Transformer,Toys上只看最后一项就赢了两条Transformer。相对最后一项,包络再涨20%到46%,说明多看几步历史有用,但有用的是可加的成对证据。相对SAS+,四个较小集上包络也高9%到28%。和TIGER论文数字的隔空对比能看出65%以上的相对优势,TIGER没有官方实现,作者明确说这种对比不能当SOTA证据。

为什么重要

这是一条很便宜的基准体检:上新序列模型之前,先过SeqRules/PCTM。过不了,涨分多半不是高阶交互,是近因和转移。Amazon Beauty/Sports/Toys被这篇判定为以马尔可夫为主,用它们宣称生成式推荐SOTA,证据不足。ML-20M是这五个里唯一留下27.3%缺口的,想证明注意力有额外价值,至少要在这类数据上比。

代码、冻结配置和切分哈希已公开。结论写得很窄,不谈线上任务本身有多复杂。

局限与存疑

这是RecSys 2026的extended abstract,作者标成进行中工作。五个公开基准,没有时序工业日志。PCTM相对SeqRules更强,但没有消融拆开贝叶斯平滑和对数池化各自的贡献。超参按数据集搜过(历史上限、衰减、τ),探针并不「零调」。ML-20M上Transformer仍大幅领先,说明高阶容量在更稠的序列里可能是真的,不能把五个基准一锅端说「Transformer无用」。打乱历史的正交实验不在本篇里。

术语

原文与代码

社区讨论

相关论文

全部论文解读