告别PPO训练噪声:将价值估计转为分类任务大幅提升稳定性

joecole · x · 2026-08-08

在二值奖励的强化学习场景中,传统PPO通常使用MSE回归训练Critic,但微小的价值误差会放大优势函数的噪声。

近期一篇论文提出了一种简单的改进方案:停止对标量值进行回归,转而将价值估计视为分类任务。具体做法是将MSE头替换为基于值区间的分类预测器(HL-Gauss PPO),使用交叉熵进行训练,随后解码回标量供标准GAE使用。

在Qwen模型上的数学和推理任务测试表明,该方法持续优于标准PPO和DAPO,不仅优势方差更低,模型校准度也显著提升。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →