The Disconnect Between Better Descriptive Reasoning Trace Quality and Recommendation Effectiveness
Gustavo Penha, Juan Elenter, Claudia Hauff, Hugues Bouchard, Paul Bennett, Mounia Lalmas
cs.IR
2026-08-24
Spotify 用 Qwen3-1.7B 在三个 Amazon 域做 2×2 对照:SID 对标题、有推理对无推理。标题轨迹 groundedness 从 1.58 升到 4.07,Video Games 上 Recall@10 却掉 20%。换更密的 LLM-judge 奖励才能部分救回。
生成式推荐把下一项预测写成自回归解码。物品常用 RQ-VAE 的 Semantic ID,生产系统已经在千万级目录上跑。接下来的潮流是在 SID 前面加一段自然语言推理,SIDReasoner、OneRec-Think 都走这条。SID 不在预训练词表里,要对齐:SIDReasoner 用八个辅助任务,有报告说对齐不够时推理会让准确率掉 25%。
直觉是:标题是模型本来就懂的词,「对齐税」更低,推理应该更赚。这篇把表示(SID vs 标题)和是否写推理拆开,问一个更狠的问题:轨迹写得更像人话,离线推荐就会更好吗?
共享 Qwen3-1.7B、同一批 SIDReasoner 放出的 Amazon 2018 划分和 GPT 教师轨迹。三个域:Video Games(9,053 用户 / 3,858 物品)、Office、Industrial,5-core,按时间 8:1:1,历史最长 10。SID 是三层、每层 256 的 RQ-VAE 码,共 768 个特殊 token;标题截到 32 token,生成后再用 BM25 回目录。
2×2:SID / 标题 × 无推理 / 有推理。教师轨迹内容相同,只替换物品指称。三阶段:LoRA 直出下一项;全参 SFT 学 〈think〉轨迹,推理样本和直出样本各半,物品 token 损失加权 20×;GRPO 对 16 个采样做组内相对优势,默认奖励是前缀匹配(SID 按层,标题按空白 token),梯度只打在物品 token 上。
主指标是相对无推理基线的 Δ。评测全库、按 ASIN,SID 碰撞时展开成多条,避免量化冲突虚增命中。附录核对标题臂:推理并不降低「生成文本能被 BM25 对上目录」的比例(Office 两边都是 98.0%),所以掉点不是字符串对不上。
标准 SFT 和前缀匹配 GRPO 下,加推理在三个域、两种表示上 Δ 全是负或零。掉得更大的是标题,和「对齐税」预测相反。Video Games 标题 Recall@10:无推理 0.0783,SFT 0.0627(−20%),GRPO 0.0614。SID 同域从 0.0728 到 0.0689,未达显著。Office 标题 −11% Recall@10 显著,SID 几乎持平。
付满对齐税也救不了推荐。SID-A 复现 SIDReasoner 的八任务对齐,无推理基线在 Office / Industrial 上更强(R@10 0.1609 / 0.1416 对轻量 0.1595 / 0.1361),加上推理后掉 17%–23%,比轻量 SID 更差。轨迹质量确实涨了:Gemini 2.5 Pro 打六维,轻量 SID 综合 2.22,SID-A 3.51,标题 3.33;groundedness 从 1.58 拉到 4.07。逻辑连贯和推荐理由两项仍然接近地板。SID-A 轨迹最好,推荐最差。
前缀匹配奖励太稀:70%–96% 的 prompt 上 16 个采样全是 0 分,没有优势。Games/标题上 GRPO 把平均轨迹从 69.6 词压到 1.1 词,think 块被掏空。换成 0.5 准确 + 0.25 轨迹 + 0.25 相关性的 GPT-4o-mini 奖励后,SID 在 Office / Industrial 超过无推理基线(0.1646 vs 0.1595,+3.2%;0.1401 vs 0.1361,+2.9%),Games 补回约 41% 的缺口。标题只在 Industrial 持平,Office 救不回。附录里用 E5 余弦替代 judge,Office / Industrial 几乎打平 LLM judge,说明主要是奖励变密,不是 judge 懂语义,也不是梯度打进了推理 token。
生产规模的歌单续写(约 10⁶ 歌单、10⁸ 曲目)上,推理 SFT 的 HR@30 0.6343 对无推理 0.6337,NDCG 还略低。把两路候选按倒数秩合并,HR@30 到 0.6515。推理换了一组歌,总量没有系统性变好。
| 设置(R@10) | Games | Office | Industrial |
| SID 无推理 | 0.0728 | 0.1595 | 0.1361 |
| SID 推理 SFT | 0.0689 | 0.1589 | 0.1324 |
| 标题无推理 | 0.0783 | 0.1587 | 0.1253 |
| 标题推理 SFT | 0.0627 | 0.1416 | 0.1240 |
| SID GRPO+Judge | 0.0705 | 0.1646 | 0.1401 |
「把 CoT 写清楚」和「把下一项排对」在这篇设定里是两件事。标题和八任务对齐都能改善可读轨迹,却带不走传统 leave-one-out Recall。更密的奖励能部分救回指标,轨迹分数几乎不动。如果产品要的是可解释文案,请直接优化文案;如果要的是下一项命中,先看奖励是不是 90% 的时间为零,不要默认加一段 〈think〉。
这是受控的小目录、小骨干实验,加上一条生产规模的旁证。它泼的是「推理痕迹质量 → 推荐效果」这条默认箭头,不是说推理永远无用。
只有 Qwen3-1.7B,更大模型会不会换符号未知。Stage 2 从 GPT 教师轨迹蒸馏,不是模型自己长出来的推理,OneRec-Think 那种无教师路线可能不同。评测全是离线单点 ground truth,相关但不是那一件的物品拿不到分,和 LLM-judge 的相关性分数会分叉。标题臂用 BM25 回库,和 SID 的 trie 约束不对等,尽管附录显示分辨率不是主因。GRPO+Judge 要在训练环里调 GPT-4o-mini,成本和偏差都在。歌单实验没有把同样的密奖励再跑一遍。