新论文揭示 PPO 价值函数失效原因,提出 BPCO 稳定训练

heghbalz · x · 2026-08-27

针对 LLM 推理训练中因训练 Critic 困难而转向 GRPO 的趋势,新论文深入分析了 PPO 中价值函数不稳定的根源,包括低概率 Token 的 Ratio Clipping 异常、Bootstrap 误差累积及 GAE 在长短响应下的失效。

论文提出的 BPCO (Best-Practice Critic Optimization) 方案给出了一种“作弊式”的解法:在训练阶段给 Critic 喂入策略模型看不到的完整参考答案与评分标准,从而稳定价值估计而不影响最终部署效果。实测显示,在从 1.5B 到 30B MoE 的规模扩展中,BPCO 表现稳健。

所属事件:新论文剖析 PPO 价值函数失效根源并提出 BPCO(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →