新论文:OPD 推理后追加 RL 阶段,效果胜过纯 OPD 与纯 RLVR
gregd_nlp · x · 2026-09-16
新论文研究 OPD 与 RLVR 的相互作用,核心发现:用 OPD 做推理训练后不要跳过 RL——追加一个 RL 阶段能持续提升性能。在多个推理任务上,OPD→RL 的组合优于纯 OPD、纯 RLVR 以及许多联合训练方法,给出了两阶段训练顺序的实证依据。
所属事件:新论文:OPD 推理训练后再追加 RL 效果更佳(3 条相关)→
「研究」频道最新
- 前 OpenAI Jason Wei:湿实验室数据让专用模型击败 GPT-6 Astra — vwxyzjn · 2026-09-16
- 「AI 能用纸笔手算吗」引出硬核玩法:马尔可夫链+多项式投影做词性标注 — cephaloform · 2026-09-16
- Pichai 盘点谷歌 AI for Science:基因图谱、天气模型与 300 种语言 — sundarpichai · 2026-09-16
- Periodic Labs 用万亿参数模型分析超导实验数据,表现超 Astra 与 Fable — vwxyzjn · 2026-09-16
- Periodic Labs 发布 Neon:仅用 1300 张 H200 让开源模型在材料分析上超 GPT-6 Astra — vwxyzjn · 2026-09-16
- 50 余位专家重批物理基准:多数错误来自题目与评分,前沿模型接近饱和 — zainhas · 2026-09-16