OC-GRPO算法突破大模型推理瓶颈
针对大模型处理极难问题时因无法生成正确答案而导致强化学习信号丢失的“学习悬崖”困境,研究人员提出Off-Context GRPO(OC-GRPO)算法。该算法有效解决了零奖励瓶颈,显著提升了模型的数学推理能力,在数学评测中实现了13.8%的性能提升。
2026-08-09 ~ 2026-08-09 · 2 条相关
- 突破强化学习零奖励瓶颈:OC-GRPO 算法提升数学推理 — ceciletamura · 2026-08-09
- OC-GRPO 算法突破大模型推理瓶颈,数学评测提升 13.8% — ceciletamura · 2026-08-09