新论文称 PPO-Clip 抑制探索,RIPO 让 AIME24 提升 60%

burny_tech · x · 2026-07-25

一篇新论文指出,LLM 强化学习里默认使用的 PPO-Clip 有一个几何层面的根本问题:它用欧氏方式衡量策略变化,但真实的策略更新更接近黎曼流形上的变化。

作者认为,这会让低概率但有价值的动作被过度压制,最终导致探索坍塌。为此他们提出 RIPO(Riemannian Isometric Policy Optimization),让低概率动作获得更大更新空间、高概率动作更新更保守,从而改善训练稳定性。论文称,该方法在 7 个基准上都优于现有 LLM RL 方法,AIME24 上相对 GRPO 最高提升约 60%。

所属事件:新研究指 PPO-Clip 抑制探索,RIPO 促大模型性能提升(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →