DASH:零额外开销,让自蒸馏按序列上下文给 token 加权,9 格全胜

DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models

ZhiYan Hou, Xinyu Tang, Hongyan An, Jianjin Zhang, Weizhen Wang, Yunyun Han, Gengsheng Li, Xiangzhao Hao, Haiyun Guo, Wenbin Hu, Jinqiao Wang, Yafeng Deng

cs.AI

2026-08-07

把局部散度相对序列均值的偏离转成传播门,用 GAE 式反向聚合给 token 级蒸馏加权,3 规模 9 格全超 matched OPSD。

这篇在解决什么

RLVR(用可验证奖励训练推理模型)靠答案对错这种自动可验的信号,但信号稀疏、只在序列级,每个 token 对最终结果的贡献分不清,这是时序信用分配难题。OPSD(on-policy self-distillation)缓解稀疏:学生自己生成 rollout,同一模型拿到参考答案等特权信息后当老师,在学生访问过的每个前缀给 token 级的分布监督。

但标准 OPSD 有个被忽视的毛病:它给每个局部散度(每个位置老师-学生的 KL)同样的系数 1/T,不管它在序列里什么位置、前面累积了什么失配历史。可在自回归生成里,同样大小的局部散度可能跟在完全不同的失配轨迹后面。论文用数据证实:当前局部散度对未来平均散度的预测很弱,两个局部散度相同的分叉点,后续会走出截然不同的散度剖面。

方法

DASH(Divergence-Adaptive Supervision Horizons)。核心是把「局部信号相对序列均值的高低」转成传播门,再用它控制反向多步聚合。

步骤如下:

关键:门和均值都 detach,梯度只过局部信号。复用 OPSD 已经算好的师生分布,不加任何额外前向,额外的标量反向扫描占 step time 不到 1%。

结果

3 个数学 benchmark(AIME 2024/2025、HMMT Feb 2025),3 个 Qwen3 规模(1.7B/4B/8B),Avg@12:

模型OPSD 均值DASH 均值
Qwen3-1.7B41.8745.07+3.20
Qwen3-4B63.6065.00+1.40
Qwen3-8B64.8066.40+1.60

9 个 benchmark-规模设置全部最高,每个 benchmark 每个规模都比自己的 OPSD 重跑高。比次优的 PW-OPSD 在 1.7B 高 1.64、8B 高 1.17。

消融讲清了收益来源:固定 λ(最优 0.1)把均值从 41.87 抬到 43.63,DASH 到 45.07,说明一部分来自多步聚合本身、一部分来自自适应;把门的方向反过来(Inverse-gap)只有 42.10,几乎等于 OPSD,说明门不是任意加的,信号必须是「小偏差开、大偏差关」;把动态分配与单纯放大系数做 2×2 分离,动态分配加 2.40/2.50 分,单纯放大只加 0.70/0.80,说明收益主要来自相对分配而非监督变强。前向 KL(45.07)也明显优于对称 JSD(38.23)和反向 KL(41.47)。

为什么重要

对做推理模型后训练的人,这是个几乎免费的 OPSD 改进:不动前向、不加参数、不到 1% 开销,把均匀的 token 级蒸馏权重换成看上下文的权重。增益不大(1.43.2 分)但稳。更值钱的可能是它点出的那个观察:标准 OPSD 的目标对「同样散度值的不同时序排列」不变,这本身是个结构性盲点,后面可能还有更多可挖。

局限与存疑

没有对单 seed 基线(EOPD/AVSD/PW-OPSD 是单跑,Base/SFT/GRPO 是外部引用)做统计显著性检验,论文自己也说「最高分」只是「显示结果里最高」,不等于统计显著优于它们。增益绝对值小,且只在数学推理上验证,code 和其他长程任务没测。检查点选择是在评测 benchmark 上「200 步内取最优」(best-within-200-step),不是 held-out 验证,有一定挑选嫌疑,论文对此是坦白的。那个固定视野梯度分解只是「结构性动机」,DASH 并不恢复它点出的那个 trajectory 项,论文明确声明没做未来到过去的信用分配,理论动机和实际做法之间有距离。

术语

原文与代码

社区讨论

相关论文

全部论文解读