EMNLP 论文:先 OPD 后 RLVR 两阶段训练,稳定优于联合优化
xiye_nlp · x · 2026-09-16
EMNLP 2026 Findings 论文《Sequential Beats Joint》系统比较了在线策略蒸馏(OPD)与可验证奖励强化学习(RLVR)两种后训练方法的组合方式。
- 简单的两阶段方案「先 OPD 后 RL」在逻辑与数学推理基准上一致优于纯 OPD、纯 RLVR 以及加权叠加、teacher 调制等所有联合基线
- 机制解释:OPD 扩大学生对 teacher 支撑解的覆盖,RL 在该支撑内锐化;两信号同时优化会互相干扰
- 切换时机:OPD 验证集分数平台期即可转 RL;OPD 也是比 SFT 更好的 RL 冷启动
- 观察:切换后 top-K 重叠下降但共享 token 上的概率上升,说明 RL 仍在 teacher 支撑内锐化
实用结论:不需要新的目标函数,跑到验证分平台再切 RLVR 即可。
所属事件:新论文:OPD 推理训练后再追加 RL 效果更佳(3 条相关)→
「研究」频道最新
- AI Evals FAQ 更新至 48 问:新增敏感数据、大 trace、LLM 裁判等实操问答 — HamelHusain · 2026-09-16
- NVIDIA 在 Hugging Face 发布 6-DoF 姿态估计基础模型 FoundationPose — _akhaliq · 2026-09-16
- 3 周精读斯坦福 CS329A 九讲:生成器已跑赢验证器 — le_james94 · 2026-09-16
- DeepSeekMath-V2 把验证做成产品:验证算力随生成器一起扩展 — le_james94 · 2026-09-16
- RLVR 不教新能力?DeepSeekMath 数据:RL 提升 Maj@K 不提升 Pass@K — le_james94 · 2026-09-16
- Math-Shepherd 用 rollout 替代 80 万人标注,GSM8K 升至 84.1% — le_james94 · 2026-09-16