Best Practice Critic Optimization
Penghui Qi, Xiangxin Zhou, Wee Sun Lee
cs.LG, cs.AI, cs.CL
2026-08-25
BPCO 给 LLM 的 critic 套一套能跑稳的配方:DPPO、值函数卡在奖励区间、Monte Carlo 目标、不归一化优势、按长度调 GAE。数学推理上从 1.5B 到 30B-A3B,单条采样即可对齐或超过每题 16 条的 Dr.GRPO。
GRPO 一类方法用同一题的一组回答互相比较,省掉了 critic,也把同一条回答里的所有 token 打成同一个结果优势。代价是每题要采多条。critic 理论上能从一条轨迹给出 token 级优势,但 LLM 上的 PPO 配方经常不稳:比率裁剪对高低概率 token 不公平,bootstrapped 值目标会把 critic 误差喂回策略,固定 GAE 又让长回答里的终点奖励指数衰减。
常见实现还有两处错位。线性值头可以预测到奖励区间外面;按 batch 把优势标准化,会在策略已经接近最优、残差信号变小时,把噪声放大成大更新。
BPCO 从 verl 默认配方开始,在一个故意很小的可解集上逐步加组件。数据是 1,460 道 DeepSeek-R1-Distill-Qwen-1.5B 已经能做对的数学题,合适的优化应当把训练奖励推到接近 100%。推不上去就当优化病,不当能力病。
六步是:
更大实验里的 critic 基线已经包含解耦 GAE 和长度自适应 GAE,但仍用无界值头和优势标准化。BPCO 相对它只多了有界值和原始优势。策略目标一律 DPPO。组基线是每题 16 条的 Dr.GRPO,并减少不同 prompt 数以对齐每轮总轨迹。
主结果画在曲线里,正文几乎不给 AIME 的最终点估计。能确定的对照关系如下。
在 DeepScaleR(约 40.3K 题,最长 24k token)上微调 1.5B,BPCO 变体的训练奖励、解释方差和 AIME 2025 avg@32 都持续高于组基线和 critic 基线。图上 BPCO+Ans 把 avg@32 拉进 30% 出头,基线停在更低的区间。去掉值有界会变慢、验证更差;重新打开优势标准化会让优势幅度再涨,收益不大但仍不建议加回去。参考答案作为 privileged 输入加速训练并抬高 AIME;官方解答只覆盖 7.3K 题,也有一点帮助。小数据集上 privileged 会更快过拟合,验证更早掉头。
Qwen3-30B-A3B 和 Base 在 DAPO-Math-17k、最长 12k token 上,BPCO 仍高于 critic 基线。A3B 上 critic 基线在前 100 步之后就不再抬 AIME 2025。相对组基线,BPCO 在 A3B 上更好,在 Base 上相当。
Qwen3-4B-Base 加 OpenRubrics、由冻结的 Instruct 模型按细则打分时,两个 BPCO 变体都比组基线和 critic 基线学得快,组基线后期能追上。把细则只给 critic 看提高了解释方差,但没提高最终奖励。任务偏简单,细则对 critic 的额外帮助用不上。
每题采 16 条在长 CoT 上很贵。如果单条加 critic 能对齐组相对优势,异步单轨迹 RL 和长回答训练的成本结构会改。BPCO 的贡献不是新算法名,是把已经散落在 VC-PPO、VAPO、DPPO 里的选择收成一套能过「小数据必须拟合」体检的默认配方。
有界值头和关掉优势标准化是两个很小、很好抄的实现细节。privileged critic 值得在有参考答案的数学任务上试,不要默认接到所有任务上。
证据只覆盖数学和细则奖励,没有代码或对话 RL。BPCO 需要已知奖励区间。privileged 变体依赖评测端信息。critic 的算力和显存没有按墙钟对齐。AIME 数字主要靠图,缺少表上的最终均值和方差。小可解集上的「能拟合」不等于大集上的最佳泛化,论文自己也用 AIME 盯过拟合。细则任务上组基线后期打平,单条的优势更多是样本效率,不是最终天花板。