SelfDR 自蒸馏框架:让 LLM 推荐保留推理收益、免付推理成本
_reachsumit · x · 2026-09-04
arXiv 论文 SelfDR(CIKM'26)提出从推理中自蒸馏的 LLM 推荐框架,解决显式生成推理链带来的高计算开销问题。
- 用同一底座 LLM 构建师生两代推荐器,无需外部模型
- 教师:以下游推荐效果为奖励训练推理器,生成有针对性的 rationale 并加入输入
- 学生:直接推荐模型,通过带动态加权策略的自蒸馏向教师学习
- 在三个公开数据集上验证了效果、合理性与效率的提升
核心思路:把推理增强的预测蒸馏为直接预测,保留推理收益的同时保持推理效率。代码已开源。
「研究」频道最新
- MIT 媒体实验室将办 ScienceClaw 黑客松,打造科学领域的智能体互联网 — ProfBuehlerMIT · 2026-09-20
- Schmidhuber 考古:1971 年 Ivakhnenko 已用 8 层网络建模经济 — SchmidhuberAI · 2026-09-20
- Qwen 研究员:人工标注数据可能比自动标注更噪 — antoine_chaffin · 2026-09-20
- 检索评测数据集隐患多,用 LLM 重标注旧数据成解法 — CShorten30 · 2026-09-20
- 北航团队提出 PhyFilter:仿真平地训练的机器人直接征服碎石路 — jiqizhixin · 2026-09-20
- ICLR 收稿暴涨 200% 至 6 万篇摘要,审阅需约 250 人年 — gleech · 2026-09-20