研究揭示GRPO训练崩溃原因及ICML前沿AI进展

Xiaoxiao Li团队在近期研究中揭示了被广泛用于推理模型训练的GRPO算法频繁崩溃的原因:模型会逐渐对自身输出丧失信心导致梯度失稳,并提出了使基准性能提升达45%的修复方案。此外,本周ICML还分享了数学证明验证的扩展与测试时长程任务规划等前沿AI系统研究。

2026-07-08 ~ 2026-07-08 · 2 条相关