Do Sequential Recommendation Benchmarks Really Require Higher-Order Sequence Modelling?
Aleksandr V. Petrov, Praveen Chandar, Paul N. Bennett, Hugues Bouchard, Mounia Lalmas
cs.IR
2026-08-20
两个不含高阶序列表示的近因加权成对探针,在eSASRec协议下于三个Amazon集上以15%到38%超过复现的eSASRec,MovieLens-20M上落后27.3%。多数常用基准测不出Transformer多出来的容量。
序列推荐越来越像语言模型:Transformer编码器、生成式检索,号称在抓高阶、上下文相关的交互。基准分数涨了,并不等于这些基准真需要那份容量。分数也可能来自流行度、一阶转移和近因。
更早的神经推荐复现研究里,18个方法只站住7个,其中6个还常被简单启发式打过。序列这边有人打乱历史看顺序是否有信号。这篇问的是另一刀:即便顺序有用,是不是只要「历史里每个物品各自提供一对转移证据」就够了,并不需要P(下一项|物品B且物品C)这种不可分的联合项。
探针故意不学高阶序列表示。先放三个只看最后一次点击的对照:经验马尔可夫链MC、SASRec式的分解马尔可夫FMC、以及全目录softmax版FMC+。然后两个历史感知探针:
每个数据集取SeqRules和PCTM里更好的那个,称为成对包络。Transformer若越不过这条包络,这个基准就提供不了「高阶建模在涨分」的证据。
评测完全跟eSASRec发布的数据切分、全目录排序、过滤已见物品、不用采样负例。SAS+(sampled-softmax SASRec)和eSASRec都按同一协议复现,十个模型-数据集对上与原论文NDCG差不超过0.0033。
全目录NDCG@10:
| 数据 | FMC+ | SAS+ | eSAS | SeqRules | PCTM |
| Beauty | .0531 | .0537 | .0524 | .0605 | .0635 |
| Sports | .0271 | .0315 | .0324 | .0371 | .0368 |
| Toys | .0588 | .0575 | .0533 | .0730 | .0738 |
| ML-1M | .1206 | .1662 | .1739 | .1505 | .1815 |
| ML-20M | .1034 | .1806 | .1969 | .1115 | .1431 |
成对包络相对eSASRec:Beauty +21.2%,Sports +14.5%,Toys +38.5%,ML-1M +4.4%,ML-20M −27.3%。Amazon上FMC+已经贴近甚至超过Transformer,Toys上只看最后一项就赢了两条Transformer。相对最后一项,包络再涨20%到46%,说明多看几步历史有用,但有用的是可加的成对证据。相对SAS+,四个较小集上包络也高9%到28%。和TIGER论文数字的隔空对比能看出65%以上的相对优势,TIGER没有官方实现,作者明确说这种对比不能当SOTA证据。
这是一条很便宜的基准体检:上新序列模型之前,先过SeqRules/PCTM。过不了,涨分多半不是高阶交互,是近因和转移。Amazon Beauty/Sports/Toys被这篇判定为以马尔可夫为主,用它们宣称生成式推荐SOTA,证据不足。ML-20M是这五个里唯一留下27.3%缺口的,想证明注意力有额外价值,至少要在这类数据上比。
代码、冻结配置和切分哈希已公开。结论写得很窄,不谈线上任务本身有多复杂。
这是RecSys 2026的extended abstract,作者标成进行中工作。五个公开基准,没有时序工业日志。PCTM相对SeqRules更强,但没有消融拆开贝叶斯平滑和对数池化各自的贡献。超参按数据集搜过(历史上限、衰减、τ),探针并不「零调」。ML-20M上Transformer仍大幅领先,说明高阶容量在更稠的序列里可能是真的,不能把五个基准一锅端说「Transformer无用」。打乱历史的正交实验不在本篇里。