美团SA-RSQ用48字节存多模态特征,线上CTR相对+2.51%

SA-RSQ: A Versatile Sparse Representation Framework for Multi-modal Recommender Systems

Xiang Wang, Shigang Quan, Tingzhen Chang, Kang Yang, Sitong Chen, Yabo Fan, Xingxing Wang, Zhaodian He

cs.AI

2026-08-24

美团把2048维多模态向量压成Top-K的(Index, Prob)元组,每物品只需8到48字节。外卖广告DIN上48字节AUC到64.913;一周10%流量A/B相对无多模态基线CTR+2.51%、CPM+3.66%。

这篇在解决什么

工业推荐要把 Qwen3-VL 一类 MLLM 的 2048 维向量喂给上亿物品的检索和精排。原向量直接存会爆内存,论文里 4096 字节的稠密特征在下游 DIN 上直接 OOM。主流退路是 RQ-VAE 硬量化成 8 字节 Semantic ID:近的商品可能被切到不同码,远的挤进同一码,边界被撕开;训练还得靠 Straight-Through Estimator,量化目标和 CTR 目标对不齐。

软量化(SoftVQ-VAE)可微,但要把分布存成稠密低维向量。32 字节按 Float16 只能放下 16 维,编码器从 2048 压到 16,照样塌。缺的是中间档:既比硬 SID 保距离,又比稠密向量省空间。

方法

SA-RSQ 是残差软量化,每层不 argmin,改走 Top-K。残差和码本做缩放点积,只保留最大的 K 个 logit,其余置 −∞,再 softmax。重建是这 K 个码字的凸组合。存的是 K 个 (Index, Prob):Index 用 uint16,Prob 用 Float16。码本共享,不计入每物品字节。按他们的账:只存 Index 是 2LK 字节,Index+Prob 是 4LK 字节。L=4、K=1 为 8 字节,L=2、K=4 为 32 字节,L=4、K=3 为 48 字节。

支持集离散,一旦固定,概率和加权重建可反传,不再用 STE。训练从稠密激活(K=V)按余弦退火收到目标 K,避免一上来就把梯度封死。损失是全局 MSE、逐层残差 MSE、码本正交、以及互信息正则(样本熵要尖、batch 边际熵要匀),防止死码。

落地两条路。两阶段:离线冻结每物品的稀疏元组,在线只查表加权,码本仍可训。端到端:稀疏概率当路由,下游 CTR 梯度能回到编码器。论文用离线对比学习代理做轻量对齐。生成式推荐上他们试了 Next-Distribution Prediction:预测码本上的稀疏分布,用 KL 去对,而不是自回归硬 SID。

结果

数据是美团外卖广告私有集,物品语义来自预训练 MLLM 的 2048 维向量,下游统一成 16 维后接 DIN,报 AUC / gAUC / 重建 MSE / Semantic Cohesion。没有公开划分,也没有多种子方差。

8 字节只存 Index 时,SA-RSQ(L=4,K=1) AUC 64.616,高于 RQ-VAE 的 64.589、R-Kmeans 的 64.573、R3-VAE 的 64.515,重建误差 0.2394,硬量化多在 0.33 以上。32 字节 Index+Prob(L=2,K=4) AUC 64.836,高于同预算 16 维稠密重建(约 64.4–64.7)。48 字节(L=4,K=3)最高,AUC 64.913、gAUC 63.013、重建 0.1553。

消融(48 字节档)里,去掉互信息正则码本利用率从 100% 掉到 24.5%;去掉课程学习利用率 15.9%、重建误差 0.4942;去掉 Top-K 掩码退回稠密软量化,AUC 64.604。完整模型 Semantic Cohesion 0.9179,去掉代理对齐会掉到 0.1014,AUC 也从 64.913 降到 64.746。

生成式只是试探。NTP 硬 SID 上 SA-RSQ 的离散索引 R@10=0.0088,高于 RQ-VAE 的 0.0068 和 R3-VAE 的 0.0075;改成 NDP 后 R@10=0.0096。绝对值很低,作者不把它写成新范式。

线上是一周、10% 流量,对照「生产基线且无多模态特征」,各方法报峰值配置。SA-RSQ L=4,K=3:CTR +2.51%、CPM +3.66%。同表 RQ-VAE 四层 SID 为 +0.96% / +1.27%,R3-VAE 24 维稠密为 +0.85% / +0.97%。流量、置信区间、p 值和时延都未公开。

预算方法AUC重建 MSE
8B IndexRQ-VAE SID64.5890.4010
8B IndexSA-RSQ L=4,K=164.6160.2394
32B 元组SA-RSQ L=2,K=464.8360.1660
48B 元组SA-RSQ L=4,K=364.9130.1553

为什么重要

给「MLLM 特征进推荐」找到一档可调的中间表示:字节数跟码本维度脱钩,距离还在连续空间里。已经在外卖广告里跑过一周。AUC 提升是百分位小数,线上相对 CTR 两个点更有商业含义,但对照是「不用多模态」,不是「同等字节的最强已有系统」。适合已经在用 SID、被边界失真卡住、又不愿把 2048 维全塞进在线存储的团队。

局限与存疑

私有数据,用户/物品量和划分都不给,无法在公开基准上复核。主表是单次点估计,没有多种子。线上不给检验、不给 p99 延迟,峰值配置也不能当显著性结论。正文有一处把 8 字节写成 L=1,K=4,表里是 L=4,K=1,两种都能凑出 8 字节,实现细节对不齐。NDP 的 Recall 仍在 0.01 量级,生成式部分只证明「概率目标能训」,证明不了优于成熟 SID 生成。正交损失、MIR 系数如何迁到别的模态,没有答案。

术语

原文与代码

社区讨论

相关论文

全部论文解读