预训练推荐模型在线刷新不毁下游:Shopee 的知识-几何解耦法

Knowledge-Geometry Decoupling: Refreshable Pretrained Transfer for Streaming Recommendation

Zixuan Wang, Yuhong Chen, Yuxuan Zhu, Guidong Lei, Zhiluohan Guo, Yu Zhao, Kun Wang, Bangyang Hong, Kangle Wu, Yabo Ni, Anxiang Zeng, Cong Fu, Hui Li

cs.IR

2026-08-04

工业推荐走预训练再迁移,但线上行为漂移。KGD 用行为多 token 预测学更干净的知识,用读写权解耦让 encoder 每天刷新而不毁任务适配,八个公开集涨 4-12%,Shopee 线上人均 GMV +1.75%。

这篇在解决什么

工业推荐系统普遍走「预训练再迁移」:先在海量行为序列上预训练一个模型,再迁移到具体推荐任务。问题在于线上用户行为一直在变(分布漂移),由此冒出两个问题:从行为序列里到底该学什么?预训练模型被不断刷新时,学到的知识怎么迁移?

第一个问题的痛点:传统 next-token prediction 把「相邻」当「因果」。一个用户的行为序列其实是好几段不相干的兴趣会话拼起来的,比如刚看完自行车配件接着看裤子。直接预测下一个物品,会把这种跨会话的偶然跳转当成依赖关系学进去,得到的是脏知识。

第二个问题:预训练知识和任务特定几何(参数空间里的判别方向)对共享参数提出了冲突的优化要求,作者实测两组梯度余弦相似度接近零。现成做法要么微调把预训练知识覆盖掉,要么冻结彻底不让适应,两头不讨好。

方法

KGD(Knowledge-Geometry Decoupling)把「学什么」和「怎么迁移」拆成两套独立机制。

学什么用 BMTP(行为多 token 预测)替代 next-token prediction:不再无差别预测相邻的下一个物品,而是只保留那些跟当前物品在协同或语义上相关的未来物品作为监督。协同相关性看物品共现图的邻近度,语义相关性看文本 embedding 的余弦相似度,超过阈值才算数。这样学到的行为知识更干净、更可迁移。

怎么迁移用「读写权解耦」。一个可刷新的 encoder 拥有行为知识,每天在新数据上刷一遍;一个 task learner 通过只读交叉注意力读 encoder 的状态(key 和 value 都做 stop-gradient,梯度单向,任务的梯度回流不到 encoder),再通过 ACR(锚定校准残差)写自己的任务几何。ACR 的关键是把任务残差约束在预训练 embedding 的正交补空间里:任务能加新的判别方向,却不会反向覆盖或抹掉预训练方向。因为任务几何是「相对预训练向量的正交残差」而非绝对坐标,encoder 每天刷新也不会让任务适配失效。

结果

八个公开数据集(Amazon-2023)上,KGD 比强预训练-迁移基线提升 4-12%。Arts 数据集 +6.5% N@50,BMTP 相比 next-token prediction 在 Games 上 +33.7% N@50。

更说明问题的是 90 天生产流:KGD 一直稳住优势,而冻结迁移和缓冲重放两类基线随时间持续退化。

线上 A/B(Shopee 首页搜索,每桶 10% 流量、千万级用户):

指标提升
人均 GMV+1.75%
人均广告收入+1.53%
CTR+0.95%
CVR+0.72%

均 p<0.01。做了一周反转实验回退,GMV 掉 1.21%、收入掉 1.50%,反过来坐实了因果。已在 Shopee 全量上线,A30 上推理延迟 120ms。

为什么重要

对推荐系统从业者,这篇给了一条可落地的「持续刷新预训练但不毁下游」的路子,核心思想是读写权物理隔离加上正交残差,其实不限于推荐,任何「预训练模型要在线刷新又不能砸掉下游适配」的场景都能借鉴。A/B 的反转实验是加分项,说明作者认真做了因果检验,不是只摆离线指标。

局限与存疑

作者明确说:只覆盖经典深度学习推荐器,没碰 LLM-based 推荐器(那种知识从文本蒸馏来,迁移机制不同);流式评测和追求不变表征的增量学习是两回事;公开数据集上激进采样扭曲了真实分布,导致协同和语义两种过滤器的贡献难分清。

读完觉得站得住,但有一点:线上 A/B 只报了首页搜索一个场景,90 天生产流也没给绝对 AUC,只给了相对趋势。生产落地有场景特异性,别指望换到别的业务也直接拿这个百分比。

术语

原文与代码

相关论文

全部论文解读