Meta 提出两阶段训练法:先做规则蒸馏再做 RL,缓解奖励黑客

meta · hf · 2026-10-07

Meta 发布新研究,针对开放式任务无法用精确结果验证、规则(rubric)奖励只在整段回复后给出、训练信号稀疏的问题,提出两阶段框架:

在 HealthBench、ResearchQA、RubricHub Science 上用开源权重模型评测,两阶段框架得分高于对比的后训练方法;且 RP-OPD + RL 在 RubricHub Science 上几乎没有奖励黑客迹象,而 SFT + RL 基线越来越多地靠声称符合 rubric 而不提供实质内容拿高分。结论:先让 rubric 引导在线蒸馏,再做 rubric RL。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →