EMNLP 论文:先 OPD 后 RLVR 两阶段训练,稳定优于联合优化

xiye_nlp · x · 2026-09-16

EMNLP 2026 Findings 论文《Sequential Beats Joint》系统比较了在线策略蒸馏(OPD)与可验证奖励强化学习(RLVR)两种后训练方法的组合方式。

实用结论:不需要新的目标函数,跑到验证分平台再切 RLVR 即可。

所属事件:新论文:OPD 推理训练后再追加 RL 效果更佳(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →