RIPO 指出 PPO-Clip 的欧氏度量压垮了 LLM 强化学习探索

GenSI · hf · 2026-07-23

RIPO 认为 PPO-Clip 的问题是几何度量错了

这篇论文把 LLM 强化学习里的 exploration collapse 归因于一个更基础的问题:PPO-Clip 用的是欧氏度量来衡量策略差异,但策略更新实际更适合放在 Riemannian manifold 的几何结构下理解。作者认为,这种几何不匹配会让低概率区域的更新过于保守、高概率区域又过于激进,最终压缩探索空间。

方法:Riemannian Isometric Policy Optimization

实验结果

论文的核心观点是:PPO-Clip 的瓶颈不只是调参或启发式不足,而是目标函数本身存在更深层的几何错配。

所属事件:新研究指 PPO-Clip 抑制探索,RIPO 促大模型性能提升(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →