新论文:OPD 推理后追加 RL 阶段,效果胜过纯 OPD 与纯 RLVR

gregd_nlp · x · 2026-09-16

新论文研究 OPD 与 RLVR 的相互作用,核心发现:用 OPD 做推理训练后不要跳过 RL——追加一个 RL 阶段能持续提升性能。在多个推理任务上,OPD→RL 的组合优于纯 OPD、纯 RLVR 以及许多联合训练方法,给出了两阶段训练顺序的实证依据。

所属事件:新论文:OPD 推理训练后再追加 RL 效果更佳(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →