OC-GRPO算法突破大模型推理瓶颈

针对大模型处理极难问题时因无法生成正确答案而导致强化学习信号丢失的“学习悬崖”困境,研究人员提出Off-Context GRPO(OC-GRPO)算法。该算法有效解决了零奖励瓶颈,显著提升了模型的数学推理能力,在数学评测中实现了13.8%的性能提升。

2026-08-09 ~ 2026-08-09 · 2 条相关