MuSeR: Scalable Long-sequence Recommendation with Multi-interest Modeling
Yongkang Fu, Beining Bao, Yu Jiang, Xiangyu Zhao, Hongyang Wei, Guangxing Chen, Zuodong Yang, Shantao Li, Zonggang Wu, Yuqi Lu, Shouke Qin, Hanmeng Liu, Maolin Wang
cs.IR
2026-09-20
分层压缩超长行为、多query拆兴趣、再用文本语义补齐稀疏ID。工业首页召回Recall@100从0.0714升到0.0870;百度App线上日活+0.26%、时长+0.89%,检索延迟降27%。
百度App首页、发现流和短视频要在毫秒级里对上用户兴趣。用户跨新闻、问答、短视频能攒到10⁴–10⁵次行为,里面既有几年不变的偏好,也有互相冲突的意图。生产系统通常把历史截到几百条,长期兴趣直接扔掉;纯ID embedding对冷启和短视频尤其薄。Transformer对十万级序列是平方级,线上SLA一般<300 ms,装不进去。
MuSeR(Multi-interest Sequence Representation)不宣称新的建模原语,目标是把超长压缩、多兴趣、多模态对齐做成可上线的召回通道,挂在已有的MGS(基于HNSW的多目标检索)上。
分层时间压缩:近期片段原样保留,中期按16个邻居做池化,早期按64。压缩后长度Lc = Nr + (Nm−Nr)/16 + (T−Nm)/64。线上取Nr=800、Nm=2000,Lc约1000是效果和算力的折中。压缩序列用6层Transformer编码(d=512,8头)。
多query兴趣:M个可学习query对编码做注意力,得到M个兴趣向量,正交正则λ=0.01防止塌成同一个方向。训练时每个头都去预测未来行为;在线按候选embedding对M个头做softmax加权。默认6头,发现流从多头里拿到的增益大于首页(相对提升0.0358对0.0286)。
多模态:ERNIE-4.0-Turbo先写物品文本摘要,再蒸馏到ERNIE-Speed,用BGE(768维)变成语义向量,和ID embedding以可学习的0.7/0.3初始化融合。短视频还可接Visualized-BGE/VISTA。
系统侧把长期兴趣异步算好放缓存,在线只跑短序列,再按负载β(t)融合。异步刷新可砍掉约60%重复编码。检索在HNSW图上做分层beam search,底层欧氏距离扩邻居,上层用DNN打语义、互动、转化等多目标。图建在CPU,遍历和打分在GPU/昆仑NPU。相对扁平HNSW,端到端检索延迟降27%,工程成本降35%以上。
公开集是Amazon 2023的Instruments / Scientific / Video Games,5-core后序列截到50,和「十万级历史」不是同一设定。MuSeR在三套上都高于最强基线NANN,Instruments的Recall@5从0.0373到0.0381(p<0.05),Games的Recall@10从0.0910到0.0919。公开集上的步子很小。
工业离线(约1亿用户、1000万物品、单月日志):
| 方法 | Home Recall@100 | Home Recall@500 | Discovery Recall@100 | Discovery Recall@500 |
| SASRec | 0.0389 | 0.1176 | 0.0569 | 0.1372 |
| NANN | 0.0714 | 0.1982 | 0.1012 | 0.2287 |
| TIGER | 0.0511 | 0.1654 | 0.0721 | 0.1881 |
| KuaiFormer | 0.0524 | 0.1701 | 0.0818 | 0.1932 |
| MuSeR | 0.0870 | 0.2232 | 0.1377 | 0.2534 |
消融(Home Recall@500):不压缩长序列0.2351,截短0.1749,分层压缩0.2232。多模态把Home从0.1636拉到0.2232(+36.4%),Discovery从0.1892到0.2534(+33.9%)。Beam search(0.2232/0.2534)接近暴力搜(0.2328/0.2671),HNSW更快但召回更低。
线上A/B从2025年初铺到首页,再扩发现和短视频,用户哈希分桶,下游排序不变。首页DAU +0.26%、总时长 +0.89%(均p<0.05)。2025年8月全量。论文称在成熟多路召回上,单路能到这个量级就算有用。
工业召回缺的往往不是又一个注意力变体,是让10⁵历史、多意图、文本语义同时活在时延预算里。分层压缩用可接受的0.0119 Recall代价换可上线;多模态在工业集上的相对提升远大于公开集那0.001的Recall@5。异步缓存加分层beam,是这篇真正能复用的部分。对已经在用HNSW多目标检索的团队,这是一套集成清单,不是新的损失函数。
公开实验把序列截到50,验证不了超长压缩的核心主张,三套Amazon上的领先幅度也只有千分位。作者自己写「不是新原语」,贡献在系统集成,学术增量有限。线上只报了DAU和时长,没有CTR/CVR分场景表,也没有把MuSeR当唯一召回源的对照。MGS内部实现引用的是另一篇未展开的工作。兴趣头数和Lc的「最优」来自工业集扫描,换产品线要重做。文本摘要链路用ERNIE,迁移到非百度栈要换模型并重测成本。