RIPO 指出 PPO-Clip 的欧氏度量压垮了 LLM 强化学习探索
GenSI · hf · 2026-07-23
RIPO 认为 PPO-Clip 的问题是几何度量错了
这篇论文把 LLM 强化学习里的 exploration collapse 归因于一个更基础的问题:PPO-Clip 用的是欧氏度量来衡量策略差异,但策略更新实际更适合放在 Riemannian manifold 的几何结构下理解。作者认为,这种几何不匹配会让低概率区域的更新过于保守、高概率区域又过于激进,最终压缩探索空间。
方法:Riemannian Isometric Policy Optimization
- 提出 RIPO,核心目标是在 Riemannian manifold 上做等距策略更新。
- 通过这种方式平衡 探索/利用,并改善优化中的 bias-variance trade-off。
实验结果
- 在 7 个竞赛级基准上评估。
- 论文称,相比现有 LLM RL 算法有明显提升;在 AIME24 上对 GRPO 的提升最高可达 60%。
论文的核心观点是:PPO-Clip 的瓶颈不只是调参或启发式不足,而是目标函数本身存在更深层的几何错配。
所属事件:新研究指 PPO-Clip 抑制探索,RIPO 促大模型性能提升(2 条相关)→
「研究」频道最新
- 3D ResNet 论文八年突破 3000 引用,Kinetics 数据集成里程碑 — HirokatuKataoka · 2026-09-11
- 把数据调度变成优化的一部分:样本选择与排序影响 LLM 训练 — Puzzleheaded_Box2842 · 2026-09-11
- Jeff Heaton《神经网络数学导论》开放免费完整下载 — blaizedsouza · 2026-09-11
- 数学家 Daniel Litt 上线问题库,15 题仅 1 题被解,用来追踪 AI 解题进度 — littmath · 2026-09-11
- AI 智能体协作优化 secp256k1 量子电路,挑战打破 ECDSA — StefanoGogioso · 2026-09-11
- Alex Townsend 汇编 200 个数值线性代数开放问题,供人类与 AI 攻关 — IgorCarron · 2026-09-11