超越熵的正确性感知RLVR

tencent · hf · 2026-07-20

超越熵:用对比策略优化做正确性感知的优势塑形

这篇论文指出,RLVR 里常用的 entropy 并不能区分“有用的不确定性”和“有害的混乱”,因此并不是理想的正确性信号。

作者提出 Contrastive Policy Optimization(CPO):通过参考引导分布与普通生成分布之间的 token 级对比不一致性来做优势塑形,并证明这种不一致性可以较稳定地反映 token 级正确性。论文还给出两个重要结论:

实验结果显示,CPO 在域内与域外基准上都明显优于基于 entropy 的 RLVR 方法,同时保持了较强泛化。作者进一步分析认为,正确与错误回答分别更支持探索与利用,而二者平衡最好。

所属事件:新研究提出CPO以优化RLVR正确性感知(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →