RIPO 指出 PPO-Clip 的欧氏度量压垮了 LLM 强化学习探索
GenSI · hf · 2026-07-23
RIPO 认为 PPO-Clip 的问题是几何度量错了
这篇论文把 LLM 强化学习里的 exploration collapse 归因于一个更基础的问题:PPO-Clip 用的是欧氏度量来衡量策略差异,但策略更新实际更适合放在 Riemannian manifold 的几何结构下理解。作者认为,这种几何不匹配会让低概率区域的更新过于保守、高概率区域又过于激进,最终压缩探索空间。
方法:Riemannian Isometric Policy Optimization
- 提出 RIPO,核心目标是在 Riemannian manifold 上做等距策略更新。
- 通过这种方式平衡 探索/利用,并改善优化中的 bias-variance trade-off。
实验结果
- 在 7 个竞赛级基准上评估。
- 论文称,相比现有 LLM RL 算法有明显提升;在 AIME24 上对 GRPO 的提升最高可达 60%。
论文的核心观点是:PPO-Clip 的瓶颈不只是调参或启发式不足,而是目标函数本身存在更深层的几何错配。
所属事件:新研究指 PPO-Clip 抑制探索,RIPO 促大模型性能提升(2 条相关)→
「研究」频道最新
- Hamel Husain:Opus 5 成本高 6 倍却跑输评测 — HamelHusain · 2026-07-25
- 字节与莫纳什论文把任务经验蒸馏进软件代理权重 — imjustnewatai · 2026-07-25
- Snorkel AI 认为 Agent 评测该从生产 trace 重建 — AI Engineer · 2026-07-25
- OPUS 在优化器空间选数,并构建 3000 万 token 代理池 — VoidAsuka · 2026-07-25
- 统计物理论文研究插值附近的 MLP 最优学习 — burny_tech · 2026-07-25
- ICML 论文称正则化让学习更像 Hebbian,噪声则相反 — burny_tech · 2026-07-25