CPO:基于对比策略优化的感知正确性优势重塑

Weiwen Xu · hf · 2026-07-20

背景:在带有可验证奖励的强化学习(RLVR)中,传统方法常利用熵来进行优势重塑。然而,熵无法区分有用的探索(不确定性)和有害的混淆(错误),限制了其作为正确性信号的有效性。

方法:作者提出了对比策略优化(CPO)。该方法利用参考模型引导的生成分布与原始生成分布在 token 级别上的对比分歧,来实现感知正确性的优势重塑。

结论:

所属事件:新研究提出CPO以优化RLVR正确性感知(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →