Meta 发布 DASO 方法,优化生成式推荐模型在树结构任务中的训练信号
_reachsumit · x · 2026-08-24
Meta 提出了一种名为 Difficulty-Aware Semantic-ID Optimization (DASO) 的训练方法,旨在解决生成式推荐模型在使用 GRPO(Group Relative Policy Optimization)进行后训练时面临的目标缺失问题。传统的 Semantic-ID 推荐将检索和排序视为分层标识符的自回归生成,但研究发现,在冻结的 SFT 检查点下,许多提示词在前 16 个候选中甚至没有命中目标分支,导致奖励信号微弱。DASO 通过分析前缀匹配深度来定位瓶颈层级,重新分配部分 rollout 组给前缀引导的补全,并引入前缀奖励和辅助 SFT 锚点。实验表明,该方法在公共基准测试中提升了模型性能。
「研究」频道最新
- AAAI 2027 承认评审过程存在串谋互评现象 — Fragrant_Fan_6751 · 2026-08-24
- 新模型 T7 Promoter 准确预测转录率 — anshulkundaje · 2026-08-24
- 研究称统计学习或为所有认知系统的涌现属性 — abenitezburraco · 2026-08-24
- 实战:用 RL 自我进化设计芯片,Kimi K3 跑出 87000 tps — brianryhuang · 2026-08-24
- 预测会改变现实:Manheim 引 Popper「俄狄浦斯效应」谈自我实现预言 — davidmanheim · 2026-08-24
- 优化评测应修复评测而非构建合成环境 — xeophon · 2026-08-24