PPO 价值函数改用分类训练,数学推理 pass@256 涨 9.6 分

Start Classifying: Categorical Critics for LLM Reinforcement Learning

Zhijian Zhou, Long Li, Xuan Zhang, Zongkai Liu, Yulei Qin, Ke Li, Xing Sun, Xiaoyu Tan, Chao Qu, Yuan Qi

COLM 2026

cs.LG

2026-08-03

把 PPO 的价值函数从 MSE 回归换成高斯平滑的分类头(actor 不变),Qwen2.5 数学推理 pass@256 涨 9.6 分、avg@256 涨 2.86 分。

这篇在解决什么

PPO 训练大模型推理时,靠一个价值函数(critic)给每个推理中间状态打分,估计从这里走到终点能拿到多少累计奖励。这个分数减去实际回报,差值就是用来更新策略的优势(advantage)。critic 历来用一个标量输出层配 MSE 损失去拟合回报,最朴素也最常见的做法。

问题不在「标量回归算不算对」。在 RLVR 这种「答对给 1、答错给 0」的稀疏奖励下(论文取 γ=λ=1),某个中间状态的真实价值就是「最终答对的概率」,标量 MSE 在统计上能收敛到这个值。真正的麻烦在优化和校准:critic 的微小高估会被直接放大成不对称的优势。critic 把一道本该失败的题估成「有六成把握答对」,失败轨迹拿到的负优势是 -0.6,而成功的正优势只有 +0.4,惩罚比奖励重得多,策略更新就歪了。论文测下来,标准 MSE critic 的负/正优势比能到 2.6 倍。

方法

HL-Gauss PPO 只动 critic 的输出层和损失,actor、rollout、采样全部不变,是真正的即插即用。三步:

为什么这么设计:锐利的 one-hot 目标会把预测推向概率单纯形的顶点,那里的 Fisher 信息矩阵接近奇异、优化条件很差;高斯平滑把目标拉回内部,让预测不至于过度自信。论文专门用 one-hot、two-hot、伯努利双桶三组对照,把「到底是分类本身、还是输出头变大、还是目标平滑」拆开。结论是平滑才是关键,光换个多头或光做二分类都不够。

结果

数学推理(Qwen2.5-Math-7B):

方法avg@256pass@256
PPO(MSE critic)15.8838.48
DAPO(无 critic)16.0042.34
HL-Gauss PPO18.7448.06

平均分涨 2.86,pass@256 涨 9.58;单题最大涨幅在 AIME25(avg@256 从 18.60 到 23.80)。换到 Qwen3-4B-Base、带工具的数学题、以及 Search-R1 检索问答,趋势一致:Search-R1 七个数据集的 mean@1 从 44.91 升到 47.13。

校准层面的数据更直接。在 AIME24 的推理前缀上(用 256 次蒙特卡洛续写估计真实成功概率 V),HL-Gauss 把 Brier 分数从 0.203 降到 0.164,ECE 降 18%,最大校准误差降 28%。反映到优势上:MSE critic 对失败轨迹的平均负优势是 -0.597、对成功轨迹只有 +0.227,比 2.63 倍;HL-Gauss 是 -0.466 对 +0.458,几乎对称。而且随着训练推进,MSE 的这种偏斜越来越重,HL-Gauss 始终接近 1。

为什么重要

对在跑 PPO 类推理训练的人来说,这是个几乎零成本的改进:参数量只增 101 倍的那个价值头,本身只占 7B 模型约 0.006%,单步训练时间实测和原版 PPO 几乎一样。换个损失函数就能拿到稳定增益,作者也开源了代码。

它还把一个长期被忽略的点摆到台面:在 RLVR 里,critic 不只是「估得准不准」,更要紧的是「估偏的方向会不会系统性地惩罚对的、奖励错的」。哪怕 critic 在均方误差上已经很好,只要它在失败状态上偏高,策略就在吃暗亏。

局限与存疑

作者自己承认,所有实验都在 Qwen 家族、4B–7B 量级上做的,更大模型和其他架构还没验证;校准和优势的分析是诊断性的,没能证明「优势对称」就是性能提升的唯一因果中介。

读下来还有几处要泼冷水。第一,增益集中在 pass@k,avg@k 涨幅温和(2.86),说明它主要帮模型把难题「偶尔答对」捡回来,未必把最可能答案本身变强。第二,伯努利双桶对照其实有点尴尬:它把 pass@256 也顶到了 45.67,逼近 HL-Gauss 的 48.06,但 avg@256 反而比 MSE 还低,如果你只在意 best-of-k,一个二分类头可能就够用,未必需要 101 桶。第三,最优平滑带宽 σ=0.75Δ 相当锐,调到 σ=Δ 性能就掉到 17.00,意味着每个任务的奖励范围都得重新定支撑区间和带宽,不是开箱即用的默认值。第四,没有和同样做分布式的 DisPPO 正面比过,只靠定位区分。

术语

原文与代码

社区讨论

相关论文

全部论文解读