Unpaired Modality-Agnostic Generative Recommendation
Weihao Shen, Wei Chen, Fuwei Zhang, Meng Yuan, Yuqin Lan, Guojun Liu, Qingsong Hua, Wei Lin, Fuzhen Zhuang
cs.IR
2026-08-04
UnpairGR共享Transformer和残差码本,让配对、纯图、纯文观测共用一套语义ID,三数据集HR@1最高领先SynGR 22.86%。
生成式推荐(GR)把推荐问题变成生成任务:每个商品被编码成一串离散的语义 ID,推荐模型看用户历史,自回归地生成下一个商品的 ID。ID 编得好不好,直接决定语义相近的商品会不会拿到相近的 ID。现在做多模态语义 ID(用图片+文字一起编码商品)的方法,几乎都假设每个商品的图和文是成对齐全的。但真实电商库里,图片是商家传的,文字描述是运营独立维护的,两条流水线互不同步:有的商品图靠谱但描述缺失,有的描述详尽但没图。已有方法遇到不成对的数据基本用不上,不是因为信息没用,是因为它们的量化器只认「配对好的」输入。
UnpairGR 的核心判断是:不成对数据能不能用,关键不在图和文本身,而在量化这一步。语义 ID 是把连续表示切进离散码本格子里产生的,哪怕表示只挪了一点点,只要跨过了格子边界,产生的 ID 就完全不兼容。如果图像单独走一套变换、文字单独走另一套,两边稍有偏差,配对数据训出来的 ID 和纯图/纯文数据训出来的 ID 根本不在一个空间里。UnpairGR 把模态特有的处理压缩到最前面一层轻量投影,后面共享同一个 Transformer 和同一套残差码本,不管输入是配对的、纯图的还是纯文的,都在这同一套参数上更新。对配对商品,图文两路表示不是简单取平均,而是按各自在共享码本里的分配置信度(用软分配的熵衡量)加权,熵低说明这个模态的定位更笃定,权重就更高。训练目标里还加了两项正则:一项让配对商品的图文表示在量化前就对齐,一项让量化后的软分配也保持一致,防止同一件商品的不同观测被分到不相容的编码。
在 Arts、Games、Instruments 三个数据集的全量输入设置下,UnpairGR 全面超过此前最强的 SynGR:HR@1 分别高 22.86%、17.14%、12.24%,NDCG@5 最高高出 16.97 个百分点。更能说明问题的是模态缺失场景,训练和测试都只保留单一模态时,UnpairGR 依然领先,在 Games 数据集 75% 缺失设置下对纯文本输入的 HR@10 领先幅度达到 29.89%。论文还专门验证了「不同观测是否落进同一套语义空间」:同一商品的纯图 ID 和纯文 ID 与配对 ID 相比,前缀一致率(粗粒度码是否相同)高达 86.7%88.9%,精确匹配率(全部四级编码都一样)只有 12%15%,符合残差量化「越靠前越粗、越靠后越细」的设计,粗粒度语义是共享的,细节编码才分化。效率上,相比 SynGR,UnpairGR 在 Instruments 上训练时间少 42%,推理延迟低 21%。
真实推荐系统的图文数据从来不是干净配对的,这篇论文提供的是一条不用做特征补全、不用给每种模态单独建码本、也不用兜底映射规则,就能把这些「脏」数据用起来的路径。对已经在跑生成式推荐、且商品库存在图文缺失的团队,这意味着不用等数据清洗到位就能把现有的单模态素材利用起来,还顺带解决了冷启动商品(只有一种模态可用)如何生成语义 ID 的问题。
论文的消融实验证明共享 Transformer 是最关键的组件,去掉它宏平均 HR@10 从 0.1477 掉到 0.1170,降幅远超去掉共享码本或去掉不成对监督,但这也说明这套方法本质上依赖一个足够大的共享骨干网络去吸收模态差异,骨干太小时是否还成立没有验证。三个评测数据集(Arts、Games、Instruments)都是亚马逊评论类目,商品图文本身质量较高、噪声可控;论文没有测试图文本身就质量参差(比如商家上传的模糊图或机器翻译的描述)时,「可靠性加权」是否还能正确识别哪个模态该信。