SelfDR: Self-Distillation from Reasoning for LLM-Based Recommendation
Chumeng Jiang, Jiayin Wang, Xinjie Lin, Zhiqiang Guo, Hengliang Luo, Min Zhang
cs.IR
2026-09-03
CIKM 26 论文用 GRPO 训推理器给推荐造理由,再蒸回单 token 直出的学生模型,三个数据集全指标第一,延迟 109ms 比 RL 基线快 6 倍。
LLM 做推荐的最新潮流是让它先推理再推荐:要么拆成多步流水线(先抽偏好、再建画像、后打分),要么在输出结果前先生成一段推理文本。这类方法确实更准,但代价是每次推荐都要生成几百 token 的推理,单条延迟冲到 500-660 毫秒。推荐系统对延迟极其敏感,这个代价在生产环境基本不可接受。
于是问题变成:推理带来的收益,能不能在不付推理成本的前提下拿到?
SelfDR 的做法是把推理当训练信号用,不当推理产物用。整个框架只用一个 LLaMA-3.1-8B,分两个阶段:
蒸馏损失带一个动态权重 α:教师把正样本排得很靠前时多学教师,教师排崩了或者还不如学生时降权,靠教师/学生的排名差做软门控。推理时学生只输出一个字符标识符,没有任何显式推理。
三个数据集(Amazon Clothing/Home、ML1M),SASRec 取 top-20 候选做重排:
| 方法 | Clothing H@1 | Clothing N@5 | ML1M H@1 | 单条延迟(ms) |
| 最强传统基线 | 0.0079 | 0.0200 | 0.0640 | - |
| COT4Rec(多步推理) | 0.0100 | 0.0186 | 0.0575 | 250.0 |
| RecR1(RL 推理) | 0.0114 | 0.0191 | 0.0515 | 665.1 |
| SelfDR | 0.0132 | 0.0228 | 0.0845 | 109.5 |
两个数字值得单独说。一是训练侧:8B 的推理器用 GRPO 训出来后,蒸馏效果反超 GPT-4o-mini、Claude-3-Haiku、DeepSeek-V3 这些外部大模型当推理器的组合,连 GPT-5-Chat 也不如它(教师 H@1 为 0.552 对 0.429)。外部大模型的理由包含学生学不会的知识,自己训的推理器风格和分布更配。二是推理侧:109 毫秒和不做推理的 SOFT 并列全场最快,比 RecR1 快 6 倍。
这是一条把「推理增益」和「推理成本」解耦的路径。对做推荐系统的人,它说明推理增强的训练收益可以被蒸进一个零额外延迟的模型;对更广泛的 LLM 应用,「训练时推理、推理时不推理」这个范式在延迟敏感场景有直接参考价值。消融里还有一个务实发现:纯监督继续训会过拟合,纯蒸馏也不如蒸馏加标签的动态混合。
论文用 8B 底座,更小或更大规模未验证。重排设置候选只有 20 个,直接全量排序的表现没测。GRPO 训练本身仍有成本(总训练时间 54 小时,与基线相当但不算便宜)。外部大模型当推理器时 GPT-5-Chat 只在 2000 条采样上测过,结论的统计强度有限。动态权重引入四个超参,虽然敏感性分析显示平稳,换数据集仍需重调。