Preserving Item Semantics for Free: Rethinking Token Initialization in LLM-Based Generative Recommendation
Donald Loveland, Liam Collins, Bhuvesh Kumar, Danai Koutra, Neil Shah
cs.IR, cs.LG
2026-08-08
LLM 推荐加新词时默认随机初始化、丢掉语义几何;改用语义质心初始化(几行代码零开销),纯 SFT 下 Recall@5 平均涨 6.5%、冷启动最高涨 60%。
基于 LLM 的生成式推荐把物品表示成语义 ID(SID),作为特殊 token 加进 LLM 词表。理想情况下,这些 SID token 应该把语义先验带进模型,帮助泛化。但标准的扩词表做法把这些新 token 初始化成随机高斯向量,丢掉了 SID 原本携带的连续语义几何,逼着 LLM 从交互数据里把物品关系重新学一遍。作者先证明了两件坏事:从这种随机初始化训出来,SID embedding 会围绕物品流行度而不是语义组织;而且即使上昂贵的 continual pretraining(CPT),也未必能把原本的语义几何找回来。这直接削弱了「把 LLM 预训练里的语义知识带进推荐」这个卖点。
作者的修法简单到几乎是免费的:直接用 SID 对应的语义质心去初始化它的 token embedding。对第 ℓ 层的第 k 个语义码,e = Φ(c{l,k} - cbar) + mubase,其中 c 是质心、cbar 是所有质心均值、mubase 是原 LLM token embedding 的均值、Φ 投影到模型维度。两个关键设计:
SID 构造用的是 residual k-means(不是 RQ-VAE),本来就工作在原生语义空间里,质心天然可得。整套实现算法 1 里大约 6 行代码:载入质心、做均值平移、写进 embedding 矩阵对应的 SID 行,完事,无额外训练或推理开销。
五个数据集、0.6B 和 4B 两档模型。几组数字:
语义纯度上,随机初始化的 10 近邻纯度 P10 只有 0.24 至 0.37(随机基线 0.10),质心初始化常常翻倍。频谱分析把原因量化了:随机初始化下几何尺度小、被流行度主导(R32(Tpop) ≥ 0.80)、语义几乎没捕获(R32(Tsem) ≤ 0.22);质心初始化把这个翻过来,Beauty 上 Tpop 从 0.88 掉到 0.00,Tsem 升到 0.64。
纯 SFT(不做 CPT)下,Recall@5 五数据集平均涨 6.5%,收敛快 27%;Beauty 涨 15.9%、少跑 40% 步数,Toys 涨 7.4%、少跑 33% 步数。冷启动物品(训练目标频次 ≤1)收益最大:纯 SFT 下 Recall@5 平均涨 37%,MovieLens +60%、Steam +50%、Beauty +23%;即便加 1 个 CPT epoch,仍跨数据集领先 14%。
要 CPT 的场景里,质心初始化用 1 至 4 个 epoch 就到顶,随机初始化要 6 至 10 个,CPT epoch 最多省 80%。4B 模型上同样一致:Toys 纯 SFT 涨 9.8%、收敛快 43%。
对做 LLM 生成式推荐的人,这是个教科书级的「先检查默认设置」案例:一个被当成理所当然的随机初始化,正在系统性地让模型围绕流行度学、把冷启动物品晾在一边,而修它只要几行代码、零开销、参数免费。冷启动 +37%(最高 +60%)和 CPT epoch 省 80% 这两个数字,对推荐系统里最头疼的两个成本(冷启动、长 CPT 训练)都是直接利好。它也给出了一个可操作的诊断方法:用频谱分析看 embedding 是被流行度还是语义主导,能提前发现初始化是不是埋了雷。
作者自己列了几条。Beauty 是个例外:在 CPT+SFT 下,随机初始化耗 10 倍 CPT epoch 后能拿到略高的绝对性能,说明有些数据集更吃大量 CPT 重学。质心初始化的相对优势随 CPT epoch 增加而递减,4 至 6 个 epoch 后增益变小(CPT 最终也会帮随机初始化的模型学会冷启动物品)。评测范围只覆盖 CPT 和 SFT 这两个基础阶段,没有评 RL 等后续后训练。质心初始化只是「抑制」流行度编码,并没有彻底消除(表 2 里仍残留一些)。读者也要注意,这些增益是在他们这套 residual k-means SID 构造下测的,换别的 SID 方案是否同样奏效还需验证。