UNIQUE: A Unified Retrieval and Ranking System for Large-Scale Feed Recommendation
Zhuang Liu, Yongkang Fu, Zuodong Yang, Guangxing Chen, Zonggang Wu, Yuqi Lu, Shouke Qin, Shantao Li, Maolin Wang
cs.IR
2026-09-20
用反馈监督的单层扁平量化替代RQ-VAE,把码生成和target-aware排序放进同一个early-fusion Transformer。KuaiRand上HR@10相对UniGRF-HSTU高12.52%;手机百度一周A/B观看时长+0.96%、分发量+1.08%、留存+0.70%。
工业信息流仍是召回再排序。生成式召回把物品打成语义码,能避开超大ID词表,但RQ-VAE这类分层量化会把第一层的错传到后面,头部物品占满码本,长尾表示变差。召回和排序还是两套目标、两套表示,中间只递候选列表,排序监督回不去,召回质量也卡死排序上限。
UNIQUE把反馈感知的单层扁平量化和early-fusion骨架绑在一起,码生成和多目标打分共用用户表示。手机百度首页、发现页、短视频从2026年1–2月起在召回位上线。会议是RecSys 2026。
三块。EQN(End-to-End Quantization Network)先用DSSM双塔把用户反馈(相关性、CTR、时长、完播等)灌进物品向量,再做单层最近邻量化,码本EMA更新。为避免头部码挤占,把赋值距离乘上(使用频率/均值)^τ,过热的码变贵、冷码变便宜。生产用16384个单层码,替换原来的128×128分层码本,总容量相同。
UIGN编码用户资料加短/中/长期行为(公开集设定是1+100+200+200,总长501)。TDN把候选物品和候选码作为target token拼进同一Transformer,target只看用户前缀、彼此不看,一次前向同时出码logits和多任务分数。
训练损失是生成交叉熵、判别BCE/MSE、码本双塔损失、量化正则。推理先预测top码,经码到物品倒排拉候选(生产N=100个码),粗排内积筛到约1万,再按码分组细排,每码M=30条往下游送。
公开集KuaiRand-Pure:27285用户、7583物品、平均序列43.47,leave-one-out全库排序。码本1024,论文明确说这只是 sanity check。
| 模型 | HR@10 | HR@50 | NDCG@10 | NDCG@50 | CTR-AUC |
| SASRec | 0.0304 | 0.0847 | 0.0189 | 0.0310 | N/A |
| TIGER | 0.0380 | 0.0902 | 0.0205 | 0.0378 | N/A |
| HSTU | 0.0453 | 0.1418 | 0.0273 | 0.0412 | 0.7150 |
| UniGRF-HSTU | 0.0511 | 0.1453 | 0.0298 | 0.0430 | 0.7168 |
| UNIQUE | 0.0575 | 0.1510 | 0.0310 | 0.0473 | 0.7252 |
相对最强对照UniGRF-HSTU,HR@10 +12.52%,HR@50 +3.92%,NDCG@50 +10.00%,CTR-AUC绝对+0.0084。消融里拿掉生成目标HR@50掉9.01%,拿掉early fusion掉7.42%,扁平量化改回分层掉5.89%。DIN/DCN只评AUC,分别是0.6812/0.7037。
生产码本:资源占用方差从1510.85降到389.57,码簇内第一类目占比从65.43%升到78.08%。一周全流量A/B(p<0.05):
| 指标 | 相对提升 |
| 总观看时长 | +0.96% |
| 总分发量 | +1.08% |
| 用户留存率 | +0.70% |
分群:新用户(14天内)时长+1.44%,高活(周活>5天)+1.11%,低活只有+0.29%。UNIQUE贡献召回池的22.5%。长尾(历史点击后20%,182万物品)曝光份额到1.04%。峰值约1万QPS,均延迟37 ms,P80 35 ms,P99 89 ms,推理MFU 44.23%,约400张L20,成本约$0.0013/千次。正午15秒缓存命中37%,晚间30秒60%。新物品首次曝光后5分钟进训练、1小时内完成量化。
生成式召回在工业里经常死在码本塌缩和两段训练。扁平码加使用量加权赋值,是比加深RQ层更直接的均衡手段;early fusion让排序监督改写用户表示,召回不再只靠物品先验。线上时长和分发一起涨,说明没有靠收紧曝光换指标。新用户和高活两端都动,语义码对短历史有用,长序列也能被同一套encoder吃进去。
和同实验室的MuSeR比,UNIQUE走的是统一生成召排,不是超长多兴趣。两篇可以并存:一个补历史长度,一个补级联信息损失。UNIQUE在生产里仍只占召回位的22.5%,没有宣称替换整条排序链路。
KuaiRand只有7583物品,公开码本1024,撑不起「工业码本均衡」的全部叙事,那部分证据在生产分析。UNIQUE上线的是召回,细排仍在下游,统一架构的效益有多少被级联截断不清楚。低活用户几乎没吃到,短历史加弱反馈仍是生成式方法的盲区。N=100、M=30是质量和成本的折中,论文说N扩到200多样性增益很小、费用近翻倍。没有和MuSeR、也没有和「只换扁平码、不统一训练」的线上对照。公开协议是leave-one-out,流行度泄漏风险在。部署时间摘要写2月、实验节写1月,以正文实验节为准的话是1月起服务全量请求。