Closing the Long-Short View Gap in Sequential Recommendation without Cached History
Lingfeng Shi, Chengkai Huang, Lina Yao, James Caverlee
cs.IR
2026-09-06
训练看两百条、线上只看二十条的序列推荐落差,靠余弦打分重训加 2764 个参数微调补齐,免用户缓存拿到 KV 缓存方案 95.9% 的效果。
序列推荐模型(SASRec、HSTU 这类)训练时吃整条用户历史,论文的实验设置是 202402 条交互;线上有延迟预算,实际只能喂最近 20 条。直接截断的代价不小:HSTU 在 Taobao 上 NDCG@10 从 0.5231 掉到 0.4446,跌 7.9 个点。
现有补救思路是给每个用户存压缩状态,服务时取回来用。最强基线 PersRec 要全参数微调、每用户 16 KB 缓存(全库 1.44 GiB)、每次请求预填 190 个历史 token;冷启动用户没有历史可存,这套机制帮不上忙。论文要回答的问题:能不能把骨干本身训得短视角也不怕,不引入任何线上状态。
先归因,再对症下药。两个结构缺陷:
两阶段修补:
为什么只动 bias 和 LayerNorm:序列变短首先冲击 LayerNorm 的统计量;这两类参数又是所有标准骨干都有的,方案不绑死架构。
NDCG@10,1,000 负例采样排序:
| 服务时输入 | SASRec·ML-10M | HSTU·Taobao | SASRec·XLong |
| 原骨干,训练长度 | 0.2329 | 0.5231 | 0.2709 |
| 原骨干,最近 20 条 | 0.2157 | 0.4446 | 0.2380 |
| 新骨干,最近 20 条 | 0.2535 | 0.5396 | 0.3391 |
| 新骨干+短视角微调 | 0.2633 | 0.5467 | 0.3539 |
| 新骨干,训练长度 | 0.2696 | 0.5764 | 0.3656 |
要点有三个。重训骨干零样本切短视角,六组设置里五组反超原骨干的全长推理,唯一例外是 HSTU/XLong(0.3324 对 0.3441)。短视角微调后,SASRec/Taobao 的 Hit@10(0.6810)已经超过自己全长推理的天花板(0.6677)。对 PersRec,以 2,764 对 302,825,997 个可训参数、1.07 对 8.34 小时训练、零线上状态,拿到它 95.9% 的 NDCG@10(0.5467 对 0.5703);ML-10M 和 XLong 上直接赢。
滚动评测更贴近真实请求流:只看最近 20 条,连续预测九个未来位置,XLong/HSTU 九个位置全胜 PersRec(均值 0.3780 对 0.3571),Taobao/SASRec 恢复其 97.4%。
这是一条「训练侧一次性改造,换线上零状态」的完整路线。冷启动用户天然覆盖,不存在缓存还没建的问题;千级参数的适配可以在新数据上高频重跑。对推荐工程师,改动清单很具体:余弦打分和 softmax1 是骨干层修改,bias/LayerNorm 微调是通用技巧,在 SASRec、HSTU 两个骨干上都验证过。
作者列的后续方向:更长序列、语义与多模态信号、LLM 增强和生成式推荐器中的验证。读下来还有几点。峰值精度仍属于缓存方案,95.9% 就是证据,缓存可行的场景论文没有说赢。适配损失的最佳配比依数据域漂移:消融里 BCE 单独用在 HSTU/Taobao 最好,KD 单独用在 SASRec/XLong 最好,论文没给统一选择规则。评测用 1,000 采样负例,不是全库排序,绝对数会偏乐观,好在所有方法同一协议。ML-10M 上范数与流行度负相关,流行度捷径的机制解释在这里方向相反,论证最薄。