EMNLP 论文:先 OPD 后 RLVR 两段式训练全面优于联合优化
xiye_nlp · x · 2026-09-16
一项入选 EMNLP 2026 Findings 的研究(arXiv:2609.04108)系统比较了 on-policy distillation(OPD)与 RLVR 两种推理模型后训练方法,结论是简单的两阶段方案「先 OPD、再 RLVR」在逻辑与数学推理基准上稳定优于纯 OPD、纯 RLVR 以及加权混合、教师调制优势重缩放等所有联合基线。
关键发现:
- 机制解释:OPD 扩大学生模型对教师支持解空间的覆盖,RL 在该支持范围内进行锐化;两信号同时优化会互相干扰。切换到 RL 后,top-K 重叠下降而共享 token 上的概率上升——学生保留更少的教师支持选项,但把更多概率质量集中到保留的那些上。
- 实用配方:OPD 的验证集得分是切换时机的关键信号——跑到验证性能平台期再切 RL 即可,无需新目标函数。
- OPD 比 SFT 是更好的 RL 冷启动方式。
工作由 Boyan Li、Bingsen Chen 等(Xi Ye 团队)完成,论文与代码均已开源。
所属事件:新论文:OPD 推理训练后再追加 RL 效果更佳(3 条相关)→
「研究」频道最新
- 论文:预训练语料中多谈对齐,错位率从 45% 降至 9% — TuhinChakr · 2026-09-16
- 仅 20 小时驾驶数据:1 名研究员用世界模型 Odyssey-3 教会 AI 在印度开车 — soleio · 2026-09-16
- AI 是否存在硬件彩票:Transformer 因适配 GPU 而胜出? — prateekj · 2026-09-16
- Every 团队测试产出概率而非文字的新型基础模型,快 25 倍成本仅 1/600 — danshipper · 2026-09-16
- Anthropic 实测自动化对齐研究员:Claude 智能体可缓解十类对齐失败 — echen · 2026-09-16
- MIT 绘制科学任务全景图谱:科研工作与经济任务大不同 — MIT_CSAIL · 2026-09-16