CPO:基于对比策略优化的感知正确性优势重塑
Weiwen Xu · hf · 2026-07-20
背景:在带有可验证奖励的强化学习(RLVR)中,传统方法常利用熵来进行优势重塑。然而,熵无法区分有用的探索(不确定性)和有害的混淆(错误),限制了其作为正确性信号的有效性。
方法:作者提出了对比策略优化(CPO)。该方法利用参考模型引导的生成分布与原始生成分布在 token 级别上的对比分歧,来实现感知正确性的优势重塑。
结论:
- 理论和实验均表明,这种分布分歧能可靠地指示 token 级别的正确性。
- 证明了“策略蒸馏”是 CPO 的一种特例。
- CPO 解决了零优势问题。实验显示,CPO 显著优于基于熵的 RLVR 方法,且保持了出色的泛化能力。通过平衡对正确响应的利用和对错误响应的探索,能达到最佳性能。
所属事件:新研究提出CPO以优化RLVR正确性感知(2 条相关)→
「研究」频道最新
- 新论文提出 PoLar:动态跳过或循环 LLM 层级以优化推理 — ttkciar · 2026-07-22
- 斯坦福团队推出全球最快分词器 Gigatoken — StanfordAILab · 2026-07-22
- Tabul AI 推出 Metal TreeSHAP,加速 Apple silicon 上的 Shapley 计算 — Scobleizer · 2026-07-22
- ICML 教程探讨:优化理论在 2026 年的相关性 — srush_nlp · 2026-07-22
- Reddit 转发 OpenAI 的 ChatGPT 广告页面 — EcstaticAsparagus509 · 2026-07-22
- 开源 runtime 让每个仓库自定义 AI 代码审查器 — ibabufrik · 2026-07-22