南大提出 CSCR 算法:修正长链推理强化学习的信用分配

NJU · hf · 2026-08-03

南京大学研究团队指出,当前基于可验证奖励的强化学习(RLVR,如 GRPO)在处理长链推理(Long-CoT)时存在缺陷:它们将响应级别的奖励均匀分发给所有 Token,忽略了不同 Token 对最终结果的实际贡献差异。

研究团队发现,现有 On-policy 自蒸馏(OPSD)带来的概率偏移主要集中在高度可替代的表层词汇上,而非真正承载推理逻辑的 Token。为此,团队提出了反事实敏感性信用重新分配(CSCR)算法:

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →