新研究指 PPO-Clip 抑制探索,RIPO 促大模型性能提升
新论文指出,大模型强化学习中默认使用的 PPO-Clip 算法存在几何度量根本缺陷。该算法以欧氏方式衡量策略变化,偏离了真实的黎曼流形更新过程,从而导致了严重的“探索崩溃”现象。为此,研究人员提出了 RIPO 算法予以修正,并在 AIME24 测试集上取得了 60% 的显著性能提升。
2026-07-23 ~ 2026-07-25 · 2 条相关
- RIPO 指出 PPO-Clip 的欧氏度量压垮了 LLM 强化学习探索 — GenSI · 2026-07-23
- 新论文称 PPO-Clip 抑制探索,RIPO 让 AIME24 提升 60% — burny_tech · 2026-07-25