Meta 发布 DASO 方法,优化生成式推荐模型在树结构任务中的训练信号

_reachsumit · x · 2026-08-24

Meta 提出了一种名为 Difficulty-Aware Semantic-ID Optimization (DASO) 的训练方法,旨在解决生成式推荐模型在使用 GRPO(Group Relative Policy Optimization)进行后训练时面临的目标缺失问题。传统的 Semantic-ID 推荐将检索和排序视为分层标识符的自回归生成,但研究发现,在冻结的 SFT 检查点下,许多提示词在前 16 个候选中甚至没有命中目标分支,导致奖励信号微弱。DASO 通过分析前缀匹配深度来定位瓶颈层级,重新分配部分 rollout 组给前缀引导的补全,并引入前缀奖励和辅助 SFT 锚点。实验表明,该方法在公共基准测试中提升了模型性能。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →