OC-GRPO 算法突破大模型推理瓶颈,数学评测提升 13.8%

ceciletamura · x · 2026-08-09

arXiv 新论文提出了 Off-Context GRPO (OC-GRPO) 算法,旨在解决大模型在处理极难问题时,因无法生成正确答案而导致强化学习信号丢失的「学习悬崖」问题。该方法在训练阶段引入特权引导,并通过重要性校正将更新引导回无引导的原始目标。实验表明,在标准数学推理基准上,该算法较原始 GRPO 平均实现了 3.9% 的绝对提升(13.8% 相对提升),且几乎无额外计算成本。

所属事件:OC-GRPO算法突破大模型推理瓶颈(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →