EasyPPO 稳住 Critic 两种失效模式,编码任务相对 PPO 提升 14.89%

Xuanyi Zhou · hf · 2026-09-30

Xuanyi Zhou 发布 EasyPPO,指出并修复 PPO 在大模型 RL 训练中的关键不稳定来源:critic。

两种失效模式:

三个改进:actor-only overlong filtering(critic 同时在完整与截断 rollout 的回报上训练)、噪声归一化的 critic 回归(按采样回报标准差的倒数加权各 prompt 的 critic loss)、适度更小的 critic mini-batch 以限制离群影响。

结果:在 FrontierCS 连续奖励编码、AIME24 二元奖励数学推理、Search-R1 多轮搜索三类任务上全程稳定,一致超过 vanilla PPO、VAPO 和 HL-Gauss PPO;最佳验证分数相对 PPO 分别提升 14.89%、2.28%、9.47%。

所属事件:EasyPPO 固定 Critic 解决 PPO 训练崩溃(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →