EasyPPO 固定 Critic 解决 PPO 训练崩溃
Xuanyi Zhou 发布 EasyPPO,针对 PPO 在大模型 RL 后训练中的关键不稳定来源——critic 提出修复方案。该方法不引入新的 actor loss、不更换策略算法,仅通过固定 critic 即可让 PPO 在 LLM 后训练中稳定运行,实现零训练崩溃。作者指出并解决了 actor 与 critic 交互中的两种失效模式。实验显示,在编码任务上 EasyPPO 相对标准 PPO 性能提升 14.89%。
2026-09-30 ~ 2026-09-30 · 2 条相关
- EasyPPO 稳住 Critic 两种失效模式,编码任务相对 PPO 提升 14.89% — Xuanyi Zhou · 2026-09-30
- EasyPPO:固定 critic 让 PPO 回归 LLM 后训练,零训练崩溃 — teortaxesTex · 2026-09-30