新研究指 PPO-Clip 抑制探索,RIPO 促大模型性能提升

新论文指出,大模型强化学习中默认使用的 PPO-Clip 算法存在几何度量根本缺陷。该算法以欧氏方式衡量策略变化,偏离了真实的黎曼流形更新过程,从而导致了严重的“探索崩溃”现象。为此,研究人员提出了 RIPO 算法予以修正,并在 AIME24 测试集上取得了 60% 的显著性能提升。

2026-07-23 ~ 2026-07-25 · 2 条相关