Meta AI 提出 OC-GRPO,Qwen2.5-7B-Instruct 推理提升 13.8%
bronzeagepapi · x · 2026-07-23
这篇 Meta AI 论文提出了 Off-Context GRPO(OC-GRPO),目标是解决 RLVR 在困难问题上“无奖励信号、学不动”的问题。
核心思路
- 训练时允许使用“特权信息”引导 rollout,比如解题前缀或 hint;
- 但更新目标仍然回到原始的、不带 hint 的问题上;
- 为此作者引入重要性修正,把 guided rollout 的优势重新加权,避免训练目标与部署目标不一致。
论文结论
- 论文把这个修正解释为一种“行为感知”的 credit assignment;
- 重要性估计的方差只依赖 guidance 文本长度,而不是整条 rollout 长度;
- 如果没有这种修正,PrefixRL、BREAD 这类 guided baseline 在小模型上甚至可能不如 vanilla GRPO;
- 在 Qwen2.5-7B-Instruct 上,作者报告在 AIME、Gaokao、OmniMath 等数学推理基准上平均取得 3.9% 绝对提升、13.8% 相对提升。
结论
这项工作强调:带 hint 的强化学习训练要想有效,关键是更新方向不能偏离无 hint 的原始目标。
「研究」频道最新
- 新加坡国立大学做出无电子无外部供能软力传感器 — CurieuxExplorer · 2026-07-27
- Chelsea Finn:机器人 RL 的瓶颈是物理 rollout 成本 — ycombinator · 2026-07-27
- ICML 2026 口头论文复现分数重算后仍偏中等 — profjamesevans · 2026-07-27
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27
- Seed IQ 在 Doom II 里通关,引出 ARC-AGI 之后的评测问题 — Fit_Transition8824 · 2026-07-27
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27