超越熵的正确性感知RLVR
tencent · hf · 2026-07-20
超越熵:用对比策略优化做正确性感知的优势塑形
这篇论文指出,RLVR 里常用的 entropy 并不能区分“有用的不确定性”和“有害的混乱”,因此并不是理想的正确性信号。
作者提出 Contrastive Policy Optimization(CPO):通过参考引导分布与普通生成分布之间的 token 级对比不一致性来做优势塑形,并证明这种不一致性可以较稳定地反映 token 级正确性。论文还给出两个重要结论:
- On-policy Distillation 可以看作 CPO 的特例,当后验分布由外部 teacher model 提供时成立。
- CPO 还能缓解 zero-advantage 问题。
实验结果显示,CPO 在域内与域外基准上都明显优于基于 entropy 的 RLVR 方法,同时保持了较强泛化。作者进一步分析认为,正确与错误回答分别更支持探索与利用,而二者平衡最好。
所属事件:新研究提出CPO以优化RLVR正确性感知(2 条相关)→
「研究」频道最新
- OpenAI 认为长程模型要按完整行动序列做安全对齐检查 — rhiever · 2026-07-22
- 有人想训练一个一致性 LoRA,让动漫场景保持统一 — ThirdWorldBoy21 · 2026-07-22
- 图计算工作负载 854.graph500 进入 SPEC CPU 2026 — Prof_DavidBader · 2026-07-22
- BlackboxNLP 2026 因投稿激增招募额外审稿人 — hanjie_chen · 2026-07-22
- AWS 证明自蒸馏推理可在 SFT 中保住推理能力 — AWS ML Blog · 2026-07-22
- UI2App 显示截图还原远落后于真实交互恢复 — Grace Man Chen · 2026-07-22