新论文:OPD 推理训练后再追加 RL 效果更佳
一项入选 EMNLP 2026 Findings 的研究(arXiv:2609.04108)系统比较了 on-policy distillation(OPD)与 RLVR 两种推理训练方法。核心发现是:用 OPD 做完推理训练后不要跳过 RL,追加一个 RL 阶段可持续提升性能;在多个推理任务上,OPD→RL 的两段式组合均优于纯 OPD、纯 RLVR 以及联合优化方案。
2026-09-16 ~ 2026-09-16 · 3 条相关
- EMNLP 论文:先 OPD 后 RLVR 两段式训练全面优于联合优化 — xiye_nlp · 2026-09-16
- 新论文:OPD 推理后追加 RL 阶段,效果胜过纯 OPD 与纯 RLVR — gregd_nlp · 2026-09-16
- EMNLP 论文:先 OPD 后 RLVR 两阶段训练,稳定优于联合优化 — xiye_nlp · 2026-09-16