微软论文:用检索命中给兴趣假设逐条记功,修复生成式推荐信用分配
_reachsumit · x · 2026-09-25
微软团队在 arXiv 发布论文《From Interests to Semantic IDs》,针对推理增强型生成式推荐器的训练瓶颈:
- 问题:现有方法用精确匹配 SID 奖励做 GRPO 训练,在大规模商品目录下奖励过稀疏——全组 rollout 都未命中时零学习信号;同一 SID 奖励下不同推理轨迹获得相同优势,产生信用分配鸿沟。
- 方法:将每条推理轨迹拆为历史摘要、兴趣假设集合与最终 SID,用冻结检索器把每个兴趣假设当作目录查询独立执行验证;任一查询命中 top-K 即给奖励,并按查询命中情况把信用定位到具体假设,实现 span 级信用分配。
「研究」频道最新
- MIT 研究:衰老大脑语言网络保持稳健,认知衰退却照常 — DrKavner · 2026-09-26
- Déjà View 入选 NeurIPS Oral:单块循环 Transformer 打平大 10 倍的 3D 重建模型 — ZGojcic · 2026-09-26
- Google 开源 PageBreak 扫描器思路:确定性验证让 XSS 误报近零,已挖出 500+ 漏洞 — moyix · 2026-09-26
- 日本旧书店销量暴涨 5 倍:50 吨旧书被买走送美 AI 扫描后销毁 — stayndarsh · 2026-09-26
- Places Library 发布:100 个面向具身 AI 的高保真真实世界 3D 环境 — yshan2u · 2026-09-26
- AI 文本能藏多少水印信号?开发者手工推导绿名单水印数学极限 — OtherwisePush6424 · 2026-09-26