TAAL: Mitigating Early Beam Pruning in Generative Recommendation via Temporal Autoregressive Alignment
Lianjie Li, Zhiying Tu, Dianhui Chu, Hongliang Sun
cs.IR, cs.AI
2026-08-29
生成式推荐把商品编成层次语义ID后,91.9%到96.6%的检索失败出在前两个码。TAAL用联合前缀KL加PMI校准,Beauty上NDCG@10相对LETTER基线提升39.5%。
生成式推荐把商品编成层次语义 ID(SID),用编码器-解码器按 token 自回归生成下一件商品。束搜索一旦在早期把真值前缀剪掉,整棵子树就没了,后面再准也救不回来。现有工作多半打磨码本,或只保护那一条正样本路径。哈尔滨工业大学在 Beauty、Instruments、Yelp 上把 LETTER-TIGER 基线的失败拆开:束宽 20 时,53.0%–71.1% 的例子在第一个码就剪错,前两步合计占全部检索失败的 91.9%–96.6%,相当于测试集的 83.2%–92.4%。
卡点在前两个码,监督却还是逐 token 交叉熵,并不要求模型覆盖历史上真实出现过的多种转移。TAAL 就对着这两步做训练对齐和推理校准。
SID 仍由 RQ-VAE 给出,骨干仍是 T5,束搜索不变。改的是前两步的目标和打分。
训练时统计相邻商品的 (c1,c2) 联合前缀转移,验证/测试最后两项不进计数。对最近 Khist=5 次行为做 γ=0.7 的指数衰减,得到历史条件的软目标 q12。前向 KL 按链式法则拆成「第一个码的边际 KL」加「按 q1 采样 Kmc=2 条再算 c2 条件 KL」,无偏且不必枚举全部合法 c1。用前向 KL 是因为它会惩罚「数据里有、模型概率接近 0」的路径,逼着模型把多种转移都留住。总损失是原 NTP 加 α 倍这项,α 在 Beauty/Instruments/Yelp 上取 0.2/0.2/0.3。
推理时不直接加 log q12,避免热门前缀再被加一遍。用点互信息:局部转移除以全局边际,经验贝叶斯收缩 τ=30,再以 β=0.02 加到束内候选的模型对数概率上,复杂度 O(束宽)。
协议与 DIGER 对齐:leave-one-out、全目录排序。LETTER 和 APAO 按同一协议重跑。
| 方法 | Beauty N@10 | Instruments N@10 | Yelp N@10 |
| LETTER (α=0) | 0.0347 | 0.0825 | 0.0228 |
| DIGER | 0.0372 | 0.0844 | 0.0227 |
| APAO | 0.0337 | 0.0811 | 0.0216 |
| TAAL 无重排 | 0.0477 | 0.0874 | 0.0286 |
| TAAL+PMI | 0.0484 | 0.0881 | 0.0293 |
相对 LETTER,NDCG@10 分别 +39.5%、+6.7%、+28.6%。联合训练本身贡献 37.5%、5.9%、25.7%,PMI 再加 1.5%、0.8%、2.3%。完整 SID 存活率相对基线 +16.6%、+3.9%、+14.7%。只对齐 c1 能抬第一码存活,第二码和全 SID 几乎不动。全局边际和控制打乱历史在 α=0.1 时略好于 NTP,α=0.4 时掉到基线以下;历史对齐的 TAAL 在 α=0.2 和 0.4 都明显更好。束宽从 50 收到 5,存活相对增益从 +9.3% 升到 +39.4%。主结果固定随机种子 42。
生成式推荐的失败集中在 SID 最宽的那两层分叉,不是码本没学好那么简单。TAAL 不改 tokenizer、不改骨干,把语料里的历史条件转移当作覆盖监督,再用 PMI 去掉全局热度。束越窄相对收益越大,说明它吃的是早期截断,不是靠把束开大硬搜。
这是渐进改进,而且三套中小公开集、单种子。Instruments 上只有 6.7%,空间本来就比较挤。PMI 是锦上添花,真正拉候选集合的是训练目标。
转移是一阶的,多跳时间模式没建模。三套中等规模数据,工业大目录能否同样出现「前两步悬崖」还不知道。主表单一种子。PMI 的 β=0.02 并不是三条曲线各自的最优点,只是离三点最优点都不到 0.00017 NDCG。Beauty 上 NTP 的 Hit@10 已到 0.0671,TAAL 到 0.0856,绝对召回仍然不高,全目录排序下头部排序的空间有限。