Hierarchical Quantization with Domain-Adaptive Sparse Routing for Generative Cross-Domain Recommendation
Haiying He, Xiaopeng Li, Yuchen Gu, Kuo Cai, Bo Chen, Jingtong Gao, Yejing Wang, Derong Xu, Ruiming Tang, Guorui Zhou, Han Li, Xiangyu Zhao
cs.IR
2026-08-07
生成式推荐编码成语义 ID 做跨域会撞上域间异构。HD-Rec 用「粗层共享码本加细层域路由」的分层量化、常开共享专家配域专属专家的稀疏 MoE、以及路由一致性,在三个跨域基准上全面领先,Sports 与 Electronics 的命中率分别涨 17.6%、16.3%。
生成式推荐(GenRec)是这两年的一个新范式:把每个商品压成几个 token 的「语义 ID」(Semantic ID, SID),再用 Transformer 做 next-token 预测直接生成推荐结果,省掉了从候选库里检索这一步。它单域效果不错,但要扩到跨域推荐(Cross-Domain Recommendation)就麻烦了,不同域的商品语义和用户行为差异很大,服装和电子产品几乎是两套语言。
之前的做法要么用一套全局共享表示硬套所有域,容量不够;要么做轻量域适应,在域间差异大时照样失效。HD-Rec 的判断是:跨域的语义其实是分层的,粗粒度(比如「运动电子」「篮球」)可以跨域共享,细粒度的偏好差异才需要按域区分。整个框架就围绕这个判断搭起来。
HD-Rec 有三个组件,对应表示、容量和一致性三个层面。
三个跨域数据集:Clothing-Sports(休闲,Amazon)、Electronics-Phones(科技,Amazon)、Books-Movies(娱乐,Douban)。指标 Hit Rate@10 和 NDCG@10。HD-Rec 在全部 12 个域与指标组合上都是最优。
| 域 | 最强基线 GenCDR H@10 | HD-Rec H@10 | 提升 |
| Sports | 0.0403 | 0.0489 | 17.6% |
| Electronics | 0.0342 | 0.0398 | 16.3% |
| Phones | 0.0621 | 0.0683 | 9.9% |
| Clothing | 0.0265 | 0.0278 | 4.9% |
| Movies | 0.1971 | 0.1978 | 0.4% |
提升集中在中低绝对值、差异大的域(Sports、Electronics),绝对值已经很高的 Movies 基本没动。消融去掉三个组件任一个都掉,HDQ 和 DAS MoE 的贡献比 CRCL 大。代价方面,推理只慢约 2.0% 到 2.5%,路由方差降了约 6 倍,说明 CRCL 确实在约束路由。
跨域推荐长期被「必须有人或商品重叠」卡着,隐私和平台隔离让重叠很难实现。生成式加分层表示这条路线绕开了重叠前提,HD-Rec 又证明了「粗共享、细分域」是个划算的折中。对做推荐系统的人,这套分层量化和稀疏专家的组合可以直接搬到自己的多业务场景里试。
作者自己承认三点:实验只做了两域设定,更多域、更大规模域的稳定性和可扩展性没验证;方法依赖商品内容表示和语义 ID 化,元数据噪声大或与真实偏好对不齐时会受影响;只做了离线评测,动态商品库、兴趣漂移、域分布变化的真实部署场景没讨论。另外 Movies 这种绝对值高、行为密集的域提升几乎为零,说明这套方法对数据足够稠密的域边际有限。