南大提出 CSCR 算法:修正长链推理强化学习的信用分配
NJU · hf · 2026-08-03
南京大学研究团队指出,当前基于可验证奖励的强化学习(RLVR,如 GRPO)在处理长链推理(Long-CoT)时存在缺陷:它们将响应级别的奖励均匀分发给所有 Token,忽略了不同 Token 对最终结果的实际贡献差异。
研究团队发现,现有 On-policy 自蒸馏(OPSD)带来的概率偏移主要集中在高度可替代的表层词汇上,而非真正承载推理逻辑的 Token。为此,团队提出了反事实敏感性信用重新分配(CSCR)算法:
- 核心机制:作为 GRPO 的扩展,降低高敏感度 Token 的信用权重,并重新归一化 Token 级别的优势,以保留原始信用预算和验证器决定的方向。
- 实验结果:在长链数学推理基准上,CSCR 在相同策略更新次数下持续优于 GRPO 基线。消融实验证实,适度降权最有效,过度调节会导致优化不稳定。
「研究」频道最新
- Lambda 开源 4.5 亿 token 蒸馏数据,助力轻量级 AI 智能体 — TheZachMueller · 2026-08-03
- ShadowDancer:用影子学习统一动态,实现视频世界模型任意动作控制 — qixing_huang · 2026-08-03
- 深度解析同策略蒸馏与GRPO算法在大模型训练中的应用 — johnolafenwa · 2026-08-03
- 新国大提出 RL² 框架:VLA 模型域外任务成功率提升 17% — NationalUniversityofSingapore · 2026-08-03
- 开源多智能体框架:递归拆解问题并合成答案 — tom_doerr · 2026-08-03
- MLSS 2027冲绳机器学习暑期学校开放申请 — FrnkNlsn · 2026-08-03