百度MuSeR压缩十万级行为序列,线上时长+0.89%、DAU+0.26%

MuSeR: Scalable Long-sequence Recommendation with Multi-interest Modeling

Yongkang Fu, Beining Bao, Yu Jiang, Xiangyu Zhao, Hongyang Wei, Guangxing Chen, Zuodong Yang, Shantao Li, Zonggang Wu, Yuqi Lu, Shouke Qin, Hanmeng Liu, Maolin Wang

cs.IR

2026-09-20

分层压缩超长行为、多query拆兴趣、再用文本语义补齐稀疏ID。工业首页召回Recall@100从0.0714升到0.0870;百度App线上日活+0.26%、时长+0.89%,检索延迟降27%。

这篇在解决什么

百度App首页、发现流和短视频要在毫秒级里对上用户兴趣。用户跨新闻、问答、短视频能攒到10⁴–10⁵次行为,里面既有几年不变的偏好,也有互相冲突的意图。生产系统通常把历史截到几百条,长期兴趣直接扔掉;纯ID embedding对冷启和短视频尤其薄。Transformer对十万级序列是平方级,线上SLA一般<300 ms,装不进去。

MuSeR(Multi-interest Sequence Representation)不宣称新的建模原语,目标是把超长压缩、多兴趣、多模态对齐做成可上线的召回通道,挂在已有的MGS(基于HNSW的多目标检索)上。

方法

分层时间压缩:近期片段原样保留,中期按16个邻居做池化,早期按64。压缩后长度Lc = Nr + (Nm−Nr)/16 + (T−Nm)/64。线上取Nr=800、Nm=2000,Lc约1000是效果和算力的折中。压缩序列用6层Transformer编码(d=512,8头)。

多query兴趣:M个可学习query对编码做注意力,得到M个兴趣向量,正交正则λ=0.01防止塌成同一个方向。训练时每个头都去预测未来行为;在线按候选embedding对M个头做softmax加权。默认6头,发现流从多头里拿到的增益大于首页(相对提升0.0358对0.0286)。

多模态:ERNIE-4.0-Turbo先写物品文本摘要,再蒸馏到ERNIE-Speed,用BGE(768维)变成语义向量,和ID embedding以可学习的0.7/0.3初始化融合。短视频还可接Visualized-BGE/VISTA。

系统侧把长期兴趣异步算好放缓存,在线只跑短序列,再按负载β(t)融合。异步刷新可砍掉约60%重复编码。检索在HNSW图上做分层beam search,底层欧氏距离扩邻居,上层用DNN打语义、互动、转化等多目标。图建在CPU,遍历和打分在GPU/昆仑NPU。相对扁平HNSW,端到端检索延迟降27%,工程成本降35%以上。

结果

公开集是Amazon 2023的Instruments / Scientific / Video Games,5-core后序列截到50,和「十万级历史」不是同一设定。MuSeR在三套上都高于最强基线NANN,Instruments的Recall@5从0.0373到0.0381(p<0.05),Games的Recall@10从0.0910到0.0919。公开集上的步子很小。

工业离线(约1亿用户、1000万物品、单月日志):

方法Home Recall@100Home Recall@500Discovery Recall@100Discovery Recall@500
SASRec0.03890.11760.05690.1372
NANN0.07140.19820.10120.2287
TIGER0.05110.16540.07210.1881
KuaiFormer0.05240.17010.08180.1932
MuSeR0.08700.22320.13770.2534

消融(Home Recall@500):不压缩长序列0.2351,截短0.1749,分层压缩0.2232。多模态把Home从0.1636拉到0.2232(+36.4%),Discovery从0.1892到0.2534(+33.9%)。Beam search(0.2232/0.2534)接近暴力搜(0.2328/0.2671),HNSW更快但召回更低。

线上A/B从2025年初铺到首页,再扩发现和短视频,用户哈希分桶,下游排序不变。首页DAU +0.26%、总时长 +0.89%(均p<0.05)。2025年8月全量。论文称在成熟多路召回上,单路能到这个量级就算有用。

为什么重要

工业召回缺的往往不是又一个注意力变体,是让10⁵历史、多意图、文本语义同时活在时延预算里。分层压缩用可接受的0.0119 Recall代价换可上线;多模态在工业集上的相对提升远大于公开集那0.001的Recall@5。异步缓存加分层beam,是这篇真正能复用的部分。对已经在用HNSW多目标检索的团队,这是一套集成清单,不是新的损失函数。

局限与存疑

公开实验把序列截到50,验证不了超长压缩的核心主张,三套Amazon上的领先幅度也只有千分位。作者自己写「不是新原语」,贡献在系统集成,学术增量有限。线上只报了DAU和时长,没有CTR/CVR分场景表,也没有把MuSeR当唯一召回源的对照。MGS内部实现引用的是另一篇未展开的工作。兴趣头数和Lc的「最优」来自工业集扫描,换产品线要重做。文本摘要链路用ERNIE,迁移到非百度栈要换模型并重测成本。

术语

原文与代码

社区讨论

相关论文

全部论文解读