CPO:基于对比策略优化的感知正确性优势重塑
Weiwen Xu · hf · 2026-07-20
背景:在带有可验证奖励的强化学习(RLVR)中,传统方法常利用熵来进行优势重塑。然而,熵无法区分有用的探索(不确定性)和有害的混淆(错误),限制了其作为正确性信号的有效性。
方法:作者提出了对比策略优化(CPO)。该方法利用参考模型引导的生成分布与原始生成分布在 token 级别上的对比分歧,来实现感知正确性的优势重塑。
结论:
- 理论和实验均表明,这种分布分歧能可靠地指示 token 级别的正确性。
- 证明了“策略蒸馏”是 CPO 的一种特例。
- CPO 解决了零优势问题。实验显示,CPO 显著优于基于熵的 RLVR 方法,且保持了出色的泛化能力。通过平衡对正确响应的利用和对错误响应的探索,能达到最佳性能。
所属事件:新研究提出CPO以优化RLVR正确性感知(2 条相关)→
「研究」频道最新
- 3D ResNet 论文八年突破 3000 引用,Kinetics 数据集成里程碑 — HirokatuKataoka · 2026-09-11
- 把数据调度变成优化的一部分:样本选择与排序影响 LLM 训练 — Puzzleheaded_Box2842 · 2026-09-11
- Jeff Heaton《神经网络数学导论》开放免费完整下载 — blaizedsouza · 2026-09-11
- 数学家 Daniel Litt 上线问题库,15 题仅 1 题被解,用来追踪 AI 解题进度 — littmath · 2026-09-11
- AI 智能体协作优化 secp256k1 量子电路,挑战打破 ECDSA — StefanoGogioso · 2026-09-11
- Alex Townsend 汇编 200 个数值线性代数开放问题,供人类与 AI 攻关 — IgorCarron · 2026-09-11