超越熵的正确性感知RLVR
tencent · hf · 2026-07-20
超越熵:用对比策略优化做正确性感知的优势塑形
这篇论文指出,RLVR 里常用的 entropy 并不能区分“有用的不确定性”和“有害的混乱”,因此并不是理想的正确性信号。
作者提出 Contrastive Policy Optimization(CPO):通过参考引导分布与普通生成分布之间的 token 级对比不一致性来做优势塑形,并证明这种不一致性可以较稳定地反映 token 级正确性。论文还给出两个重要结论:
- On-policy Distillation 可以看作 CPO 的特例,当后验分布由外部 teacher model 提供时成立。
- CPO 还能缓解 zero-advantage 问题。
实验结果显示,CPO 在域内与域外基准上都明显优于基于 entropy 的 RLVR 方法,同时保持了较强泛化。作者进一步分析认为,正确与错误回答分别更支持探索与利用,而二者平衡最好。
所属事件:新研究提出CPO以优化RLVR正确性感知(2 条相关)→
「研究」频道最新
- Chelsea Finn:机器人 RL 的瓶颈是物理 rollout 成本 — ycombinator · 2026-07-27
- ICML 2026 口头论文复现分数重算后仍偏中等 — profjamesevans · 2026-07-27
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27
- Seed IQ 在 Doom II 里通关,引出 ARC-AGI 之后的评测问题 — Fit_Transition8824 · 2026-07-27
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27
- 一份横跨 ML、系统、NLP 与音频的经典论文清单 — deliprao · 2026-07-27