研究揭示GRPO训练崩溃原因及ICML前沿AI进展
Xiaoxiao Li团队在近期研究中揭示了被广泛用于推理模型训练的GRPO算法频繁崩溃的原因:模型会逐渐对自身输出丧失信心导致梯度失稳,并提出了使基准性能提升达45%的修复方案。此外,本周ICML还分享了数学证明验证的扩展与测试时长程任务规划等前沿AI系统研究。
2026-07-08 ~ 2026-07-08 · 2 条相关
- 研究揭示GRPO训练崩溃原因及修复 — VectorInst · 2026-07-08
- ICML研究:证明验证扩展与长程任务规划 — VectorInst · 2026-07-08