生成式推荐接入跨用户记忆库,TIGER 上各指标提升 13% 至 24%

Collaborative Memory Augmentation for Generative Recommendation

Enze Liu, Zhen Tian, Wayne Xin Zhao

KDD 2026 Research Track

cs.IR

2026-08-02

生成式推荐只建模单用户序列。OMEGA 把全局行为压成记忆库、按目标和序列相似检索、门控融合进上下文,TIGER 上各指标升 13% 至 24%。

这篇在解决什么

生成式推荐(GR)把「预测下一个物品」当成序列到序列生成:每个物品编成语义 ID,模型自回归吐出目标 ID。现有 GR 框架有个共同短板:只建模单个用户的历史序列,把全用户基的协同模式全压进固定模型参数里。这是个信息瓶颈,尤其当当前用户行为稀疏时,模型没法动态借用相似用户的信号。作者借大模型里 in-context learning 的思路,主张 GR 也该能参考行为轨迹相近的其他用户。

方法

OMEGA 是个模型无关的外挂框架(在 T5 式 encoder-decoder 上验证,主干用 TIGER 和 Pctx)。三步走:

第一步,潜上下文压缩。用 C 个可学习 query token(Q-Former 风格)把变长用户序列压成定长表示,把存储从 l×d 降到 C×d,实测 C=2 就和原 GR 持平。把所有训练序列的压缩表示聚成记忆库 M。

第二步,目标感知检索。直接用压缩表示算相似会因表示坍塌失效,所以用一个轻量序列检索器(HSTU,2 层)出查询表示。检索分同时看序列级和目标级相似:s 等于 1 减 α 乘序列余弦,加上 α 乘目标和查询的余弦,避免只按序列像不像捞回无关记忆。

第三步,上下文感知融合。取 top-K(K=10)记忆,先用检索分过一个门控(低分记忆被压向零)去噪,再用 cross-attention(去掉因果掩码)加 FFN 残差融进用户上下文,喂给解码器。训练分两阶段微调:先冻结主干只对齐注意力模块,再端到端联合优化。

结果

三个 Amazon 2023 数据集(Instrument、Scientific、Game),留一法评测:

主干加 OMEGA 后典型提升
TIGER+13.5% 至 23.7%(各指标)
Pctx+5.0% 至 15.4%

Pctx 加 OMEGA 在多数指标上达到 SOTA,把 HSTU、LETTER、LIGER、ETEGRec、ActionPiece 都压下去。消融里随机检索退化和主干几乎一样,说明模型会忽略无关记忆,检索质量是关键;用平均池化代替压缩表示也明显更差。这不是蒸馏:TIGER 加 HSTU 集成仍不如 OMEGA-HSTU。效率上,记忆检索只占推理时间不到 2%,推理慢约 1%,多约 7% 可训参数;只用 1% 的记忆库就接近全量性能。

为什么重要

它给生成式推荐补上了被丢掉的跨用户协同信号,而且是用检索增强的思路补的(类似 RAG,但是给推荐用)。对做 GR 的人,潜压缩让记忆库在存储上可行,门控加目标感知检索让信号足够干净,两阶段微调让外挂不破坏主干。这些都可拆开复用。模型无关是加分项,意味着不必绑定某一门具体的生成式推荐实现。

局限与存疑

所有实验在相对小的学术数据集上(Amazon 子集、MovieLens-1M),没有像 STEPS 或 GRACE 那样在亿级工业流量上验证,增益能否撑住生产规模未知。论文没有显式局限章节,作者只在复杂度分析里提到记忆库在超大规模下可能要聚类剪枝。1% 记忆库就够,反而说明记忆可能只编码了粗粒度通用模式,对个性化到底贡献多大值得追问。检索器用单独的 HSTU,等于又引入一个小模型和一套训练,工程上不算零成本。

术语

原文与代码

社区讨论

相关论文

全部论文解读