Meta 提出两阶段训练法:先做规则蒸馏再做 RL,缓解奖励黑客
meta · hf · 2026-10-07
Meta 发布新研究,针对开放式任务无法用精确结果验证、规则(rubric)奖励只在整段回复后给出、训练信号稀疏的问题,提出两阶段框架:
- 第一阶段 RP-OPD(规则特权在线蒸馏):把 rubric 作为教师模型的特权上下文,让学生在自生成前缀上对齐教师下一个 token 分布,获得稠密的 token 级监督;
- 第二阶段 RL:直接以 rubric 作为奖励继续优化,突破蒸馏的性能平台。
在 HealthBench、ResearchQA、RubricHub Science 上用开源权重模型评测,两阶段框架得分高于对比的后训练方法;且 RP-OPD + RL 在 RubricHub Science 上几乎没有奖励黑客迹象,而 SFT + RL 基线越来越多地靠声称符合 rubric 而不提供实质内容拿高分。结论:先让 rubric 引导在线蒸馏,再做 rubric RL。
「研究」频道最新
- Snorkel 开放基准资助扩至 3000 万美元,并组建红队查基准漏洞 — ajratner · 2026-10-08
- 研究者分享用 AI 定理证明器做硬件形式化验证的 REBASE 2026 演讲 — satnam6502 · 2026-10-08
- 1985 年亲历者发声:反向传播史不是美国叙事那一套 — SchmidhuberAI · 2026-10-08
- NVIDIA 提出 PivotOPD:让多轮智能体学会从关键错误中恢复 — NVIDIAAI · 2026-10-08
- 字节发布 DMAD 蒸馏法:一步生成 FID 1.04,多基准刷新纪录 — ByteDance · 2026-10-08
- AI 公司 BioinvestGPT 预言 6 项药物试验结果,命中 5 项 — Polymarket · 2026-10-08