EasyPPO 固定 Critic 解决 PPO 训练崩溃

Xuanyi Zhou 发布 EasyPPO,针对 PPO 在大模型 RL 后训练中的关键不稳定来源——critic 提出修复方案。该方法不引入新的 actor loss、不更换策略算法,仅通过固定 critic 即可让 PPO 在 LLM 后训练中稳定运行,实现零训练崩溃。作者指出并解决了 actor 与 critic 交互中的两种失效模式。实验显示,在编码任务上 EasyPPO 相对标准 PPO 性能提升 14.89%。

2026-09-30 ~ 2026-09-30 · 2 条相关