Auditing Semantic Gains in Sequential Recommendation: A Lightweight Recovery Test
Kong Wang, Zhongke He, Xiang Chen, Hongwei Zeng, Kai Deng, Long Wang, Kehua Yang
cs.IR, cs.AI
2026-08-02
语义推荐增益到底来自哪?SASRec 加 ItemCF 加冻结 BGE 的透明分数融合,在三个 Amazon 数据集上反超最强基线 7% 至 12%,无需在线 LM。
近两年的语义推荐和生成式推荐普遍报告相对纯 ID 序列基线的大幅提升。但这些方法都是整套系统一起评测,增益到底来自哪不清楚:是语言模型的推理能力,是语义 ID 生成,是端到端语义架构,是更强的离线物品表示,还是语义信号和协同信号本来就互补?这不是一个无关紧要的归因问题。如果大部分增益靠冻结的离线向量加简单融合就能拿回,那堆复杂语义机制可能就没必要。
LIME-Rec 不是又一个推荐架构,而是一个可审计的「恢复测试」。它把三个独立专家的分数拼起来:序列专家 SASRec(只看交互)、协同专家 ItemCF(最近 20 次交互的共现,按时间衰减加权、开方归一化压热门)、语义专家用冻结的 BGE(bge-base-en-v1.5)物品向量,按用户最近交互做衰减加权平均再算余弦。三个专家的分数先按用户做 min-max 归一化,再用一个只在验证集上拟合的轻量线性门做 softmax 加权融合,最后加一个有界的历史校准(对已交互物品扣一个上限 0.1 的分)。
关键性质是全程没有在线语言模型推理、没有语义 ID 解码、没有端到端文本优化,物品文本只在离线编码一次。每个专家的贡献都可单独查看,融合是分数级的、透明的。
三个文本丰富的 Amazon 数据集(Beauty、Toys、Sports),全目录、允许重复评测:
| 数据集 | LIME-Rec R@10 | 最强基线 GRAM | 相对提升 |
| Beauty | 0.0996 | 0.0890 | +12.0% |
| Toys | 0.1105 | 0.0987 | +12.0% |
| Sports | 0.0593 | 0.0554 | +7.0% |
LIME-Rec 在全部 12 个数据集与指标组合上最高,把 TIGER、IDGenRec、HSTU、LC-Rec、MHL 都压在下面。因子消融显示三专家融合(不带校准)就已经稳定超过带校准的 SASRec,说明恢复不是历史校准单独解释的。最有说服力的是文本对应控制:把物品的文本向量在物品 ID 间随机打乱(保留向量的数量和维度、保留整套架构),R@10 掉 13.6% 至 17.5%,融合门给语义专家的权重也同步下降,证明增益靠的是物品和文本的真实对应,不是多塞了一个分数通道。
这是一篇测量学警告,和「造个更强模型」反着来。它的实操含义是:在把推荐增益归功于在线语言建模、语义 ID 生成或重型语义架构之前,先跑一个冻结向量加透明融合的基线,看它能恢复多少。如果它能追平甚至反超,那些重型机制在这个基准上就不是「经验上必要」的。这对评估新语义推荐论文的含金量也给了把尺子。
作者很克制地强调这是「机制必要性测试」不是因果分解:轻量系统追平,不代表重型模型内部做的是同一件事,也不代表重型机制在其他场景没用。只测了三个英文、文本丰富的 Amazon 数据集,用的是一个冻结的小编码器(BGE-base),冷启动、跨域、稀疏行为等语言推理可能真正发挥作用的场景没覆盖。评测协议是全目录、允许重复(maskhistory=false)这个特定选择,换协议结论可能松动。它证明的是基准分数可达,不是重型模型多余。