新论文称 PPO-Clip 抑制探索,RIPO 让 AIME24 提升 60%
burny_tech · x · 2026-07-25
一篇新论文指出,LLM 强化学习里默认使用的 PPO-Clip 有一个几何层面的根本问题:它用欧氏方式衡量策略变化,但真实的策略更新更接近黎曼流形上的变化。
作者认为,这会让低概率但有价值的动作被过度压制,最终导致探索坍塌。为此他们提出 RIPO(Riemannian Isometric Policy Optimization),让低概率动作获得更大更新空间、高概率动作更新更保守,从而改善训练稳定性。论文称,该方法在 7 个基准上都优于现有 LLM RL 方法,AIME24 上相对 GRPO 最高提升约 60%。
所属事件:新研究指 PPO-Clip 抑制探索,RIPO 促大模型性能提升(2 条相关)→
「研究」频道最新
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- InFlux++ 方法发布 — ducha_aiki · 2026-09-11