码本利用率与推荐效果相关系数仅 −0.02,语义 ID 复现研究没有万能设计

What Makes a Good Semantic ID for Generative Recommendation? A Reproducibility Study

Yufei Chen, Junchen Fu, Jujia Zhao, Yukun Zhao, Zhaochun Ren

cs.IR

2026-09-21

统一框架复现 11 种语义 ID 设计:没有万能方案,码本利用率与效果几乎零相关,加大骨干或加长编码都不保证涨点。

这篇在解决什么

生成式推荐把每个物品编码成一串离散 token(语义 ID,SID),推荐器像写句子一样逐 token 生成下一个物品。TIGER 在 2023 年开出这条路线后,构造 SID 的方式迅速分化:RQ-VAE 残差量化、OPQ 优化乘积量化、多层平衡 K-means、跟推荐器端到端一起学的 tokenizer。每篇论文用自己的数据集和骨干报数字,这些设计差异到底贡献了多少,谁也说不清。山东大学、格拉斯哥大学与莱顿大学的团队把 11 种设计放进同一个实验框架复现,代码开源(SID-Repro)。

数据集四个:Amazon Video Games、Microlens-50K/100K、Yelp,统一按时间 70:13:17 切分,只评 warm 物品。横评用各家官方超参,控制变量分析固定在 TIGER 框架上,只换 tokenizer。

方法

四个研究问题:

结果

横评 NDCG@10(选五行):

方法Video GamesMicrolensYelp
RPG(OPQ 系)0.03010.01730.0207
TIGER(RQ-VAE)0.02720.00890.0172
LETTER-TIGER0.02570.01210.0232
SEATER0.01840.01890.0201
SASRec(无 SID)0.01520.01560.0177

没有一个方法在三个数据集上都第一。更扎眼的是 SASRec:这个不用语义 ID 的传统基线,在 Microlens 和 Yelp 上打赢 TIGER、DiffGRM、OneRec 一串生成式方法。

利用率分析:RQ-Kmeans(OneRec 的构造)一级码本完美均衡,归一化熵 1.00,256 个码全用上;TIGER 只有 0.90,161 到 166 个码在用。但一级熵与 NDCG@10 的 Pearson 相关是 −0.02,Spearman 是 −0.08,基本零相关。给 LETTER 加多样性正则能把熵抬约 0.11,NDCG 只动 0.002 以内。利用率是诊断指标,当不成优化目标。

规模化两个方向都不单调。骨干从 T5-small 加到 large,OPQ 路线的 NDCG@10 从 0.0293 一路掉到 0.0239;码长加长,RQ 系在 L=3 最优(0.0272),RQ-Kmeans 从 L=3 的 0.0276 掉到 L=12 的 0.0207,OPQ 反而 L=6 最优(0.0321)。token 越长,自回归解码出错的空间越大。

语义保持上两种构造各擅一格:OPQ 恢复近邻集合最强,四个数据集的 Jaccard@20 全部最高;RQ-Kmeans 保近邻排序最强,RBO@20 全部最高。论文称之为互补,不存在全面占优的设计。

为什么重要

这个子领域近三年的论文数字没法横比:数据、骨干、调参预算全不一样。这项研究给出三个可直接用的结论。一,别按「码本均衡」挑 tokenizer,这个直觉在数据上不成立。二,任何 SID 论文的单数据集结论都要在自己的数据上重验,排序会翻。三,SASRec 仍是必跑基线,生成式方法没有普遍优势。对要上生成式推荐的团队,先在自己的流量上做一轮这样的控制变量比对,比追新论文划算。

局限与存疑

作者自己列出:RQ2 到 RQ4 固定在 TIGER 框架,结论未必迁移到其他骨干或解码方式;横评沿用官方超参,没有逐数据集精调,小差距要谨慎解读;只评 warm 物品,冷启动没碰;算力所限骨干只到 T5-large。读下来再补一条:四个数据集都是中等规模消费者数据,更大物品目录下的行为没有验证。

术语

原文与代码

社区讨论

相关论文

全部论文解读