What Makes a Good Semantic ID for Generative Recommendation? A Reproducibility Study
Yufei Chen, Junchen Fu, Jujia Zhao, Yukun Zhao, Zhaochun Ren
cs.IR
2026-09-21
统一框架复现 11 种语义 ID 设计:没有万能方案,码本利用率与效果几乎零相关,加大骨干或加长编码都不保证涨点。
生成式推荐把每个物品编码成一串离散 token(语义 ID,SID),推荐器像写句子一样逐 token 生成下一个物品。TIGER 在 2023 年开出这条路线后,构造 SID 的方式迅速分化:RQ-VAE 残差量化、OPQ 优化乘积量化、多层平衡 K-means、跟推荐器端到端一起学的 tokenizer。每篇论文用自己的数据集和骨干报数字,这些设计差异到底贡献了多少,谁也说不清。山东大学、格拉斯哥大学与莱顿大学的团队把 11 种设计放进同一个实验框架复现,代码开源(SID-Repro)。
数据集四个:Amazon Video Games、Microlens-50K/100K、Yelp,统一按时间 70:13:17 切分,只评 warm 物品。横评用各家官方超参,控制变量分析固定在 TIGER 框架上,只换 tokenizer。
四个研究问题:
横评 NDCG@10(选五行):
| 方法 | Video Games | Microlens | Yelp |
| RPG(OPQ 系) | 0.0301 | 0.0173 | 0.0207 |
| TIGER(RQ-VAE) | 0.0272 | 0.0089 | 0.0172 |
| LETTER-TIGER | 0.0257 | 0.0121 | 0.0232 |
| SEATER | 0.0184 | 0.0189 | 0.0201 |
| SASRec(无 SID) | 0.0152 | 0.0156 | 0.0177 |
没有一个方法在三个数据集上都第一。更扎眼的是 SASRec:这个不用语义 ID 的传统基线,在 Microlens 和 Yelp 上打赢 TIGER、DiffGRM、OneRec 一串生成式方法。
利用率分析:RQ-Kmeans(OneRec 的构造)一级码本完美均衡,归一化熵 1.00,256 个码全用上;TIGER 只有 0.90,161 到 166 个码在用。但一级熵与 NDCG@10 的 Pearson 相关是 −0.02,Spearman 是 −0.08,基本零相关。给 LETTER 加多样性正则能把熵抬约 0.11,NDCG 只动 0.002 以内。利用率是诊断指标,当不成优化目标。
规模化两个方向都不单调。骨干从 T5-small 加到 large,OPQ 路线的 NDCG@10 从 0.0293 一路掉到 0.0239;码长加长,RQ 系在 L=3 最优(0.0272),RQ-Kmeans 从 L=3 的 0.0276 掉到 L=12 的 0.0207,OPQ 反而 L=6 最优(0.0321)。token 越长,自回归解码出错的空间越大。
语义保持上两种构造各擅一格:OPQ 恢复近邻集合最强,四个数据集的 Jaccard@20 全部最高;RQ-Kmeans 保近邻排序最强,RBO@20 全部最高。论文称之为互补,不存在全面占优的设计。
这个子领域近三年的论文数字没法横比:数据、骨干、调参预算全不一样。这项研究给出三个可直接用的结论。一,别按「码本均衡」挑 tokenizer,这个直觉在数据上不成立。二,任何 SID 论文的单数据集结论都要在自己的数据上重验,排序会翻。三,SASRec 仍是必跑基线,生成式方法没有普遍优势。对要上生成式推荐的团队,先在自己的流量上做一轮这样的控制变量比对,比追新论文划算。
作者自己列出:RQ2 到 RQ4 固定在 TIGER 框架,结论未必迁移到其他骨干或解码方式;横评沿用官方超参,没有逐数据集精调,小差距要谨慎解读;只评 warm 物品,冷启动没碰;算力所限骨干只到 T5-large。读下来再补一条:四个数据集都是中等规模消费者数据,更大物品目录下的行为没有验证。