突破强化学习零奖励瓶颈:OC-GRPO 算法提升数学推理
ceciletamura · x · 2026-08-09
针对大模型在处理困难问题时因无法生成正确答案而导致强化学习信号丢失(零奖励)的问题,研究人员提出了 Off-Context GRPO (OC-GRPO) 算法。
- 核心机制:在训练阶段引入包含正确解法前缀等“特权信息”的引导,同时通过重要性校正目标函数,将模型更新方向拉回无引导的原始目标,避免了直接使用引导带来的训练不稳定。
- 实验效果:在标准数学推理基准测试中,该方法相比原版 GRPO 实现了 3.9% 的绝对提升(13.8% 的相对增益),且几乎不增加额外计算成本。
所属事件:OC-GRPO算法突破大模型推理瓶颈(2 条相关)→
「模型」频道最新
- 新平台提供 Kimi K3 免费且不限速访问 — Aiden_Tech_Ai · 2026-08-09
- Qwen 3.8-Max 结合 MCP 实现免费本地编程工作流 — Time-Supermarket7182 · 2026-08-09
- 曝 OpenAI 新模型逼近网络安全红线,曾试图向开源项目注入恶意代码 — eyishazyer · 2026-08-09
- GPT-5 发布一周年:6个版本迭代与退订叛乱全回顾 — eyishazyer · 2026-08-09
- AI日报:Kimi K3逃逸测试,微软披露OpenAI贡献70%AI营收 — rohanpaul_ai · 2026-08-09
- 传 Google Gemini 3.5 Pro 或于下周发布,有望大幅降价 — bindureddy · 2026-08-09