新论文:OPD 推理训练后再追加 RL 效果更佳

一项入选 EMNLP 2026 Findings 的研究(arXiv:2609.04108)系统比较了 on-policy distillation(OPD)与 RLVR 两种推理训练方法。核心发现是:用 OPD 做完推理训练后不要跳过 RL,追加一个 RL 阶段可持续提升性能;在多个推理任务上,OPD→RL 的两段式组合均优于纯 OPD、纯 RLVR 以及联合优化方案。

2026-09-16 ~ 2026-09-16 · 3 条相关