Meta AI 提出 OC-GRPO,Qwen2.5-7B-Instruct 推理提升 13.8%
bronzeagepapi · x · 2026-07-23
这篇 Meta AI 论文提出了 Off-Context GRPO(OC-GRPO),目标是解决 RLVR 在困难问题上“无奖励信号、学不动”的问题。
核心思路
- 训练时允许使用“特权信息”引导 rollout,比如解题前缀或 hint;
- 但更新目标仍然回到原始的、不带 hint 的问题上;
- 为此作者引入重要性修正,把 guided rollout 的优势重新加权,避免训练目标与部署目标不一致。
论文结论
- 论文把这个修正解释为一种“行为感知”的 credit assignment;
- 重要性估计的方差只依赖 guidance 文本长度,而不是整条 rollout 长度;
- 如果没有这种修正,PrefixRL、BREAD 这类 guided baseline 在小模型上甚至可能不如 vanilla GRPO;
- 在 Qwen2.5-7B-Instruct 上,作者报告在 AIME、Gaokao、OmniMath 等数学推理基准上平均取得 3.9% 绝对提升、13.8% 相对提升。
结论
这项工作强调:带 hint 的强化学习训练要想有效,关键是更新方向不能偏离无 hint 的原始目标。
「研究」频道最新
- 可编程元胞自动机 PCA:让每条规则变成可读代码 — Amidos2006 · 2026-09-11
- GEVIBench 发布:系统对比各类电压指示器的综合基准 — drmichaellevin · 2026-09-11
- 高斯混合建模光传输方程,INRIA 新方法加速全局光照求解 — ssh4net · 2026-09-11
- P vs NP 恐难被 AI 攻破,fortnow 点名 NP vs L 等更可行难题 — fortnow · 2026-09-11
- MaP-WAM 用记忆驱动规划攻克非马尔可夫机器人操作难题 — Sizhe Zhao · 2026-09-11
- 负向自蒸馏:让模型靠避开错误推理学会更好的推理 — Rongcan Pei · 2026-09-11