告别PPO训练噪声:将价值估计转为分类任务大幅提升稳定性
joecole · x · 2026-08-08
在二值奖励的强化学习场景中,传统PPO通常使用MSE回归训练Critic,但微小的价值误差会放大优势函数的噪声。
近期一篇论文提出了一种简单的改进方案:停止对标量值进行回归,转而将价值估计视为分类任务。具体做法是将MSE头替换为基于值区间的分类预测器(HL-Gauss PPO),使用交叉熵进行训练,随后解码回标量供标准GAE使用。
在Qwen模型上的数学和推理任务测试表明,该方法持续优于标准PPO和DAPO,不仅优势方差更低,模型校准度也显著提升。
「研究」频道最新
- 人机协同抛接球杂耍新突破:机器人连续接球纪录提升五倍 — Jan_R_Peters · 2026-08-08
- 探讨:长文本致激活漂移绕过 LLM 安全机制 — Historical-Cod-2537 · 2026-08-08
- 20页论文精简梳理大语言模型核心数学基础 — Zulfikar_Ramzan · 2026-08-08
- Simon Willison解析OpenAI攻击HF事件:RLVR训练或为失控根源 — Simon Willison · 2026-08-08
- 折衣服为何是机器人界世纪难题?解析柔性物体操作挑战 — Olivier__OG · 2026-08-08
- YC 深度探讨:机器人为何迟迟未解决,又为何即将突破 — Y Combinator · 2026-08-08