躲开自己的坏推理,NSD 让 Qwen3-4B 七项数学平均涨 7.5 分

Negative Self-Distillation: Learning to Reason by Avoiding Flaws

Rongcan Pei, Zhepei Wei, Shuyao Xu, Xinyu Zhu, Wei-Lin Chen, Yu Meng

cs.CL, cs.LG

2026-09-10

NSD 让模型给每道题生成「粗心推理者」条件,用门控 unlikelihood 把学生推离被放大的坏 token,不需要标准答案。Qwen3-1.7B/4B/8B 在七项数学基准上平均分别涨 2.3、7.5、6.0 分。

这篇在解决什么

On-Policy Self-Distillation(OPSD)让模型当自己的老师:把标准答案当特权信息,在学生自己采样的轨迹上做稠密 token 监督。问题是这位老师已经知道答案,推理写得又直又自信。学生去贴这份分布,不确定性和自我纠错会被压掉。复杂题恰恰需要这些行为。

另一边,无标签 RL(Intuitor 用自信当奖励,TTRL 用多数票当伪标签)不需要标准答案,却把信号质量押在模型会不会自评。弱模型高自信不等于高正确,1.7B 上 Intuitor 平均还掉了 0.5 分。

NSD 换了方向:不要去模仿一份被答案喂饱的好轨迹,去躲开一份自己生成的坏推理。

方法

训练数据只用 MATH 的题目,丢掉金标。对每道题,学生先采样一条解答,再据此写出一条负条件,典型指令是「当一个粗心的推理者」。冻结一份初始权重,同一个网络跑两个前向:

门控很简单:Gt = max(0, pneg − pref)。负条件把某个 token 的概率抬上去,才罚;语法词两边都高,门就是 0。惩罚不用原始 unlikelihood(−log(1−p)),p 接近 1 时损失和梯度会炸,标点空格这类高置信结构 token 会被连根拔掉。改成 sigmoid 封顶,等价于 Gt / (2 − pθ),力道落在中低置信的推理 token 上。再加一项只在采样 token 上估计的前向 KL,权重 α=0.01,防止学生漂离参考模型。去掉 KL 会在训练中段塌掉,门控也跟着失效。

每道题只需一条学生 rollout。损失只用三个标量概率,不必对齐全词表 logits。参考和负教师权重相同,前向可以并行。

结果

Qwen3-1.7B/4B/8B,非 thinking 模式,Avg@8,七项基准(AIME 24/25/26、HMMT 2025、AMC 2023、OlympiadBench 675 道开放题、MATH-500):

模型基线OPSDIntuitorTTRLNSD
1.7B ΔAvg0+1.1−0.5+0.3+2.3
4B ΔAvg0+1.0+1.3+0.2+7.5
8B ΔAvg0+0.3+1.9−0.1+6.0

4B 的 AIME 2024 从 23.8% 到 35.8%,8B 从 28.8% 到 39.6%。1.7B 的增益小得多,p 值仍到 0.001;4B/8B 的 ΔAvg 置信区间整体在零以上。Qwen3-4B 上,反思词(如 wait)每条回复平均:基线 3.6,OPSD 2.2,Intuitor 0.8,NSD 7.5。负条件不必在线生成。只看题目离线写负条件,4B 平均 +7.3,接近默认在线的 +7.8;把不相干维基百科段落当噪声,仍有竞争力,单步墙钟从 68s 降到 54s。Thinking 模式下 4B 仍平均 +3.0。

为什么重要

这是一条不吃标准答案、也不吃外部更强老师的推理后训练路径。信号来自负条件把哪些 token 抬高了,不来自模型对自己对不对的判断,避开了自信 RL 在小模型上的空转。单 rollout、标量损失,比 GRPO 类方法的 8 条采样和 OPSD 的全词表对齐更省。

4B、8B 涨得多,1.7B 涨得少,和「负条件质量跟模型能力走」是一件事。把它当通用配方之前,先看底座会不会写出有信息量的负条件。

局限与存疑

作者承认,极小或极弱的模型写不出有用的负对比,优化会变钝。在线策略还要额外生成负条件,并跑两次冻结前向;他们用 wiki-irr 这种免生成变体把延迟压下去,主结果仍以在线方案为准。

实验全在 Qwen3 和数学题上。门控是两个概率的差,没有证明它分离的就是「推理错误」而不是「被负提示激活的风格」。反思词变多不等于证完了自我纠错,频率统计加个案,没有把纠错成功率单独测开。训练只用 MATH 两轮,分布外到代码或通用智能体轨迹,这篇没有给。

术语

原文与代码

相关论文

全部论文解读