EMNLP 论文:先 OPD 后 RLVR 两段式训练全面优于联合优化

xiye_nlp · x · 2026-09-16

一项入选 EMNLP 2026 Findings 的研究(arXiv:2609.04108)系统比较了 on-policy distillation(OPD)与 RLVR 两种推理模型后训练方法,结论是简单的两阶段方案「先 OPD、再 RLVR」在逻辑与数学推理基准上稳定优于纯 OPD、纯 RLVR 以及加权混合、教师调制优势重缩放等所有联合基线。

关键发现:

工作由 Boyan Li、Bingsen Chen 等(Xi Ye 团队)完成,论文与代码均已开源。

所属事件:新论文:OPD 推理训练后再追加 RL 效果更佳(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →