给 GRPO 的 token 功劳重算账,长思维链数学推理五项齐涨

Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning

Qiangqiang He, Zhongheng Wu, ZiJian Wang

cs.AI

2026-07-30

自蒸馏给 GRPO 的 token 优化方向其实反映反事实敏感度、而非答案信号;据此削敏感 token 的功劳,Qwen3 上 5 项数学基准最多涨 8 分。

这篇在解决什么

GRPO 这类无 critic 的强化学习方法,把整条回答的奖励压成一个优势值,再均匀摊到每一个 token 上。一条几千 token 的长思维链里,真正决定对错的推理步骤、走岔的分支、以及基本被前缀决定好的续写,拿到的是同样大小的功劳。后来出现的 OPSD(on-policy self-distillation,在线自蒸馏)想补这个漏:它拿一个「被告知了答案对错」的特权策略当老师,让普通学生策略去拟合老师,假设老师相对学生产生的概率变化里藏着「往正确答案靠」的 token 级信息。

这篇直接检验了这个假设,结论是它不成立。

方法

作者用一个反事实实验戳穿了 OPSD 的前提。对同一道题、同一条采样出来的思维链 y,把轨迹和每一个前缀都冻住,只改「告诉模型这条轨迹对还是错」,然后看每个 token 的对数概率怎么动。两个对立条件分别是 c^pos(「验证器判定下面这份解法最终答案正确,非常棒」)和 c^neg(「判定错误,很糟」)。

zi^pos 和 zi^neg 就是两种条件下相对基线的概率位移。如果 OPSD 的假设成立,这两种对立条件应该把 token 往相反方向推;真正承载推理内容的 token 应该位移最大。

实测完全不是这样:

也就是说,特权位移量大的不是「对答案重要的 token」,而是「换个说法也行的 token」,它衡量的是反事实敏感度,不是 token 的学习价值。

CSCR(Counterfactual Sensitivity Credit Reallocation)就是基于这个诊断做的最小改动:取每个 token 的敏感度 s = max(|z^pos|, |z^neg|),超过阈值 λ 的 token 按指数衰减把功劳权重压低(最多压到 1−γ),低于阈值的保持 1,最后在整条轨迹内做归一化,保证总功劳预算不变、奖励方向还是验证器定的。本质上是把功劳从「敏感的表面 token」挪给「不敏感的实质 token」。

结果

在 Qwen3-1.7B 和 Qwen3-4B 上,用 DAPO-17K 数学题训练 300 步,5 项竞赛级基准 Mean@32:

模型方法AMC23AIME24AIME25AIME26SMT25
Qwen3-1.7BGRPO84.147.436.737.439.5
Qwen3-1.7BCSCR88.850.143.642.244.0
Qwen3-4BGRPO96.971.565.065.357.4
Qwen3-4BCSCR97.874.468.367.259.0

1.7B 上五项平均涨约 6 分(AIME25 单项 +8.1 最大),4B 上平均涨约 3.7 分。同样的策略更新步数,CSCR 全程奖励曲线高于 GRPO,且没有靠缩短回答作弊,响应长度反而略增。

消融把诊断钉死了。如果反过来用位移符号去给 token 定方向(SD-GRPO),训练 30 步内必然崩:奖励掉到零、熵归零、回答顶到 20480 token 上限退化成乱码。再看调制强度:温和下调权(γ=0.2)最稳;上调权或强下调(γ=0.5、1.0)都会让优化发散或回答塌缩到两三千 token。

为什么重要

对做长思维链 RL 的人,这篇给了一个便宜、即插即用的 GRPO 补丁,代码改动很小,只在优势计算前乘一个权重。更值钱的是它的诊断结论:很多「密集 token 级监督」的直觉(包括自蒸馏、各种 token 级 credit)默认 token 的概率位移就等于它对答案的贡献,而这篇用反事实实验证明,至少在长 CoT 数学推理里,位移大的往往是文体而非内容。

局限与存疑

只验证了数学推理,代码、通用推理能否迁移没给数据。CSCR 需要对每条采样的轨迹在两个对立条件下重新打分,比原生 GRPO 多算两遍前向,训练成本明显上升,论文没量化这部分开销。敏感度阈值 λ 和调制强度 γ 都要调,论文自己承认强了会崩,实际换模型换数据可能要重调。还有一个作者没正面回答的问题:被压低权重的敏感 token 里,有没有可能混着真正有用的推理 token,只是恰好可替换性也高。

术语

原文与代码

相关论文

全部论文解读