新论文称 PPO-Clip 抑制探索,RIPO 让 AIME24 提升 60%
burny_tech · x · 2026-07-25
一篇新论文指出,LLM 强化学习里默认使用的 PPO-Clip 有一个几何层面的根本问题:它用欧氏方式衡量策略变化,但真实的策略更新更接近黎曼流形上的变化。
作者认为,这会让低概率但有价值的动作被过度压制,最终导致探索坍塌。为此他们提出 RIPO(Riemannian Isometric Policy Optimization),让低概率动作获得更大更新空间、高概率动作更新更保守,从而改善训练稳定性。论文称,该方法在 7 个基准上都优于现有 LLM RL 方法,AIME24 上相对 GRPO 最高提升约 60%。
所属事件:新研究指 PPO-Clip 抑制探索,RIPO 促大模型性能提升(2 条相关)→
「研究」频道最新
- 统计物理论文研究插值附近的 MLP 最优学习 — burny_tech · 2026-07-25
- ICML 论文称正则化让学习更像 Hebbian,噪声则相反 — burny_tech · 2026-07-25
- AI 自主完成 9000 行数学证明,攻克复杂流体力学方程 — burny_tech · 2026-07-25
- 罕见标点能否变成 LLM 的一字符语气信号? — Fcking_Chuck · 2026-07-25
- RL 持续提升 Agent 想象力模型,Photon-1 性能反超 Gemini — ycombinator · 2026-07-25
- 有人想从一张照片生成不变姿势的侧面和背面图用于 3D 建模 — LoudPoem9492 · 2026-07-25