Meta AI 提出 OC-GRPO,Qwen2.5-7B-Instruct 推理提升 13.8%

bronzeagepapi · x · 2026-07-23

这篇 Meta AI 论文提出了 Off-Context GRPO(OC-GRPO),目标是解决 RLVR 在困难问题上“无奖励信号、学不动”的问题。

核心思路

论文结论

结论

这项工作强调:带 hint 的强化学习训练要想有效,关键是更新方向不能偏离无 hint 的原始目标。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →