Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning
Qiangqiang He, Zhongheng Wu, ZiJian Wang
cs.AI
2026-07-30
自蒸馏给 GRPO 的 token 优化方向其实反映反事实敏感度、而非答案信号;据此削敏感 token 的功劳,Qwen3 上 5 项数学基准最多涨 8 分。
GRPO 这类无 critic 的强化学习方法,把整条回答的奖励压成一个优势值,再均匀摊到每一个 token 上。一条几千 token 的长思维链里,真正决定对错的推理步骤、走岔的分支、以及基本被前缀决定好的续写,拿到的是同样大小的功劳。后来出现的 OPSD(on-policy self-distillation,在线自蒸馏)想补这个漏:它拿一个「被告知了答案对错」的特权策略当老师,让普通学生策略去拟合老师,假设老师相对学生产生的概率变化里藏着「往正确答案靠」的 token 级信息。
这篇直接检验了这个假设,结论是它不成立。
作者用一个反事实实验戳穿了 OPSD 的前提。对同一道题、同一条采样出来的思维链 y,把轨迹和每一个前缀都冻住,只改「告诉模型这条轨迹对还是错」,然后看每个 token 的对数概率怎么动。两个对立条件分别是 c^pos(「验证器判定下面这份解法最终答案正确,非常棒」)和 c^neg(「判定错误,很糟」)。
zi^pos 和 zi^neg 就是两种条件下相对基线的概率位移。如果 OPSD 的假设成立,这两种对立条件应该把 token 往相反方向推;真正承载推理内容的 token 应该位移最大。
实测完全不是这样:
也就是说,特权位移量大的不是「对答案重要的 token」,而是「换个说法也行的 token」,它衡量的是反事实敏感度,不是 token 的学习价值。
CSCR(Counterfactual Sensitivity Credit Reallocation)就是基于这个诊断做的最小改动:取每个 token 的敏感度 s = max(|z^pos|, |z^neg|),超过阈值 λ 的 token 按指数衰减把功劳权重压低(最多压到 1−γ),低于阈值的保持 1,最后在整条轨迹内做归一化,保证总功劳预算不变、奖励方向还是验证器定的。本质上是把功劳从「敏感的表面 token」挪给「不敏感的实质 token」。
在 Qwen3-1.7B 和 Qwen3-4B 上,用 DAPO-17K 数学题训练 300 步,5 项竞赛级基准 Mean@32:
| 模型 | 方法 | AMC23 | AIME24 | AIME25 | AIME26 | SMT25 |
| Qwen3-1.7B | GRPO | 84.1 | 47.4 | 36.7 | 37.4 | 39.5 |
| Qwen3-1.7B | CSCR | 88.8 | 50.1 | 43.6 | 42.2 | 44.0 |
| Qwen3-4B | GRPO | 96.9 | 71.5 | 65.0 | 65.3 | 57.4 |
| Qwen3-4B | CSCR | 97.8 | 74.4 | 68.3 | 67.2 | 59.0 |
1.7B 上五项平均涨约 6 分(AIME25 单项 +8.1 最大),4B 上平均涨约 3.7 分。同样的策略更新步数,CSCR 全程奖励曲线高于 GRPO,且没有靠缩短回答作弊,响应长度反而略增。
消融把诊断钉死了。如果反过来用位移符号去给 token 定方向(SD-GRPO),训练 30 步内必然崩:奖励掉到零、熵归零、回答顶到 20480 token 上限退化成乱码。再看调制强度:温和下调权(γ=0.2)最稳;上调权或强下调(γ=0.5、1.0)都会让优化发散或回答塌缩到两三千 token。
对做长思维链 RL 的人,这篇给了一个便宜、即插即用的 GRPO 补丁,代码改动很小,只在优势计算前乘一个权重。更值钱的是它的诊断结论:很多「密集 token 级监督」的直觉(包括自蒸馏、各种 token 级 credit)默认 token 的概率位移就等于它对答案的贡献,而这篇用反事实实验证明,至少在长 CoT 数学推理里,位移大的往往是文体而非内容。
只验证了数学推理,代码、通用推理能否迁移没给数据。CSCR 需要对每条采样的轨迹在两个对立条件下重新打分,比原生 GRPO 多算两遍前向,训练成本明显上升,论文没量化这部分开销。敏感度阈值 λ 和调制强度 γ 都要调,论文自己承认强了会崩,实际换模型换数据可能要重调。还有一个作者没正面回答的问题:被压低权重的敏感 token 里,有没有可能混着真正有用的推理 token,只是恰好可替换性也高。