新论文剖析 PPO 价值函数失效根源并提出 BPCO

针对 LLM 推理训练中因 Critic 难以训练而普遍转向 GRPO 的趋势,新论文深入分析了 PPO 中价值函数不稳定的根源,包括低概率 Token 的 Ratio Clipping 等问题,并指出社区常见实现存在诸多缺陷。研究同时提出 Best Practice Critic Optimization(BPCO),总结了一套在 LLM 强化学习中可靠训练 Critic 的最佳实践,为稳定 PPO 训练提供了新方案。

2026-08-27 ~ 2026-08-27 · 2 条相关