新研究提出CPO以优化RLVR正确性感知

针对强化学习中常用的熵指标,最新研究指出其无法区分“有用的探索”与“有害的混乱”,并非理想的正确性信号。为此,研究人员提出基于对比策略优化(CPO)的优势重塑方法。该方法旨在更精准地感知正确性,从而突破传统基于熵的强化学习在有效性上的局限,提升模型的整体表现。

2026-07-20 ~ 2026-07-20 · 2 条相关