新论文揭示 PPO 价值函数失效原因,提出 BPCO 稳定训练
heghbalz · x · 2026-08-27
针对 LLM 推理训练中因训练 Critic 困难而转向 GRPO 的趋势,新论文深入分析了 PPO 中价值函数不稳定的根源,包括低概率 Token 的 Ratio Clipping 异常、Bootstrap 误差累积及 GAE 在长短响应下的失效。
论文提出的 BPCO (Best-Practice Critic Optimization) 方案给出了一种“作弊式”的解法:在训练阶段给 Critic 喂入策略模型看不到的完整参考答案与评分标准,从而稳定价值估计而不影响最终部署效果。实测显示,在从 1.5B 到 30B MoE 的规模扩展中,BPCO 表现稳健。
所属事件:新论文剖析 PPO 价值函数失效根源并提出 BPCO(2 条相关)→
「研究」频道最新
- RetrievalRouter:自适应选择检索管道以提升文档检索精度与速度 — Emre Kuru · 2026-08-27
- Gwern 深度解析进化作为强化学习的后盾 — CatAstro_Piyush · 2026-08-27
- Gaussian 技术实现 Clug 角色面部表情动画 — repligate · 2026-08-27
- Lightwheel 联合 Hugging Face 发布 10 万小时具身人类数据集 — vanstriendaniel · 2026-08-27
- PyTorch 生态新增 Perforated 等 10 个项目 — zhyncs42 · 2026-08-27
- V-Rubrics:基于细粒度标准的视觉忠实度强化学习 — liuziwei7 · 2026-08-27