突破强化学习零奖励瓶颈:OC-GRPO 算法提升数学推理

ceciletamura · x · 2026-08-09

针对大模型在处理困难问题时因无法生成正确答案而导致强化学习信号丢失(零奖励)的问题,研究人员提出了 Off-Context GRPO (OC-GRPO) 算法。

所属事件:OC-GRPO算法突破大模型推理瓶颈(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →