EasyPPO 稳住 Critic 两种失效模式,编码任务相对 PPO 提升 14.89%
Xuanyi Zhou · hf · 2026-09-30
Xuanyi Zhou 发布 EasyPPO,指出并修复 PPO 在大模型 RL 训练中的关键不稳定来源:critic。
两种失效模式:
- 从 actor 和 critic 中同时过滤截断 rollout,会把策略目标偏移到「以完成为条件」的奖励上,即使条件奖励提升,截断率也可能上升。
- 异质回报噪声使高方差 prompt 在有限 batch 中主导 critic 更新。
三个改进:actor-only overlong filtering(critic 同时在完整与截断 rollout 的回报上训练)、噪声归一化的 critic 回归(按采样回报标准差的倒数加权各 prompt 的 critic loss)、适度更小的 critic mini-batch 以限制离群影响。
结果:在 FrontierCS 连续奖励编码、AIME24 二元奖励数学推理、Search-R1 多轮搜索三类任务上全程稳定,一致超过 vanilla PPO、VAPO 和 HL-Gauss PPO;最佳验证分数相对 PPO 分别提升 14.89%、2.28%、9.47%。
所属事件:EasyPPO 固定 Critic 解决 PPO 训练崩溃(2 条相关)→
「研究」频道最新
- 图像判断基准 ImageJevBench v0.2 发布:573 图,Imajev 4B 居首 — airesearch12 · 2026-09-30
- alphaXiv 开源 OpenResearch 桌面版:把编码 Agent 变科研 Agent — gekobraa · 2026-09-30
- 政府气象模型 WRF 移植 GPU,速度快一个量级出 250 米分辨率 — Scobleizer · 2026-09-30
- François Fleuret:AI 数学将让人类数学彻底边缘化 — francoisfleuret · 2026-09-30
- GPU 空转高达 74%,微软研究院 SortedRL 直击 RL 训练调度瓶颈 — burkov · 2026-09-30
- UMass 教授 Luc Rey-Bellet 三套随机过程讲义公开,覆盖 MCMC 基础 — michaelchchoi · 2026-09-30