SPOT:给在线蒸馏加稀疏探测,数学推理多样本覆盖比基线高 5 个点

SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation

Zikun Qu, Min Zhang, Mingze Kong, Zhiwei Shang, Yikun Ban, Shuang Qiu, Zhongxiang Dai

cs.LG, cs.AI

2026-08-05

只探教师不确定且学生没覆盖的位置,用真实通过率校准候选 token;0.6B 至 4B 学生 Pass@8 全面最高,比 EOPD 高近 3 个点。

这篇在解决什么

把大模型的推理能力蒸馏到小模型上,主流有三条路。监督微调和离线蒸馏拿教师生成的轨迹训练学生,但学生见到的上下文跟自己推理时产生的不一样,会累积暴露偏差。在线强化学习直接优化学生自己生成的轨迹,但推理类 RL 通常只有序列级或终局的验证奖励,信号太粗。在线策略蒸馏(OPD)取两者之长:在学生自己生成的前缀上训练,同时保留密集的 token 级教师反馈。

OPD 通常最小化反向 KL,这有个毛病:反向 KL 是「找峰」的,会把概率堆到教师最偏好的那个续写上,对其他同样合理的续写给的概率不够。前作 EOPD 想用教师熵当开关,在熵高的位置补一个 top-k 的前向 KL 项来保覆盖。但熵高本身说明不了三件事:教师的不确定性到底是集中在少数几个 token 上,还是摊在一条长长的概率尾巴上;学生是不是已经把这些候选表示得够好;教师局部的下一个 token 概率,到底能不能预测下游成不成。SPOT 就来补这三块。

方法

SPOT 把「在哪探、蒸馏什么」拆成两个耦合的决策,走「获取、探索、利用」三步。获取阶段给每个位置打一个分,由三项相乘:归一化的教师熵(这里教师确实不确定)、教师 top-ks 候选集合捕获的质量(不确定性集中在少数几个 token 而非长尾)、学生跟教师的差距(学生还没覆盖或排序不同)。任何一项低,这个位置的优先级就被拉低,有限的探测预算 M 只花在最值钱的位置上。

探索阶段:在被选中的位置,把教师 top-kp 的每个候选 token 接到前缀上,让学生续写,用验证器打分,估出这个候选的「学生可执行价值」。只保留至少有一个候选拿到正奖励的位置。利用阶段:拿这些验证过的价值,在教师分布附近的一个 KL 信任域里构造一个闭式目标,把概率往下游结果更好的候选上倾斜,但仍锚定在教师分布上。训练损失就是标准 OPD 损失加上这些位置上的分支损失。验证器没找到任何正奖励时,分支损失为零,退化回标准 OPD。

关键在于它把教师的局部分布当「提案先验」而不是「下游成败的定论」,再用学生真实续写的结果去校准。

结果

教师用关掉思维模式的 Qwen3-8B,学生是 Qwen3-0.6B/1.7B(在 MATH 上训)和 Qwen3-4B(在 DAPO-Math-14k 上训),评六个数学推理基准。SPOT 在三种学生规模上 Pass@8 宏平均都最高,Avg@8 最高或第二高。

学生方法Avg@8Pass@8
Qwen3-4BOPD35.6649.57
Qwen3-4BEOPD35.4551.81
Qwen3-4BSPOT36.1354.30

相对标准 OPD,SPOT 的 Avg@8 提升 0.47 到 1.48 个点,Pass@8 提升 4.55 到 5.28 个点;相对最接近的 EOPD,Avg@8 提升 0.29 到 0.68 个点,Pass@8 提升 2.49 到 3.19 个点。Pass@8 涨得比 Avg@8 多得多,说明 SPOT 放大了「能凑出多种解法」的覆盖,而不是把单次准确率稀释掉。消融显示获取分数的三项缺一不可,去掉验证器校准会掉 7.38 个 Pass@8 点。

为什么重要

对做蒸馏的人来说,这是个干净又克制的改进点:与其在每个高熵位置都补前向 KL,不如先判断「教师的不确定是不是集中在少数候选、学生是不是已经会了」,只把昂贵的探测花在该花的地方,再用真实结果而不是教师概率来定目标。它尤其对「多样本投票」的推理场景有用,因为 Pass@8 才是那种场景真正在意的指标。

局限与存疑

实验只覆盖数学推理(六个基准全是数学),没测代码或别的推理任务,泛化性存疑。学生只有 0.6B 到 4B,教师只有一个 Qwen3-8B,更大的学生或更强的教师能不能保持这个增益不清楚。Avg@8 的提升其实不大(亚 1.5 个点),故事主要撑在覆盖(Pass@8)上。探测要额外做 M×kp×Np 次续写加验证器调用,虽然预算可控但毕竟是额外开销,论文没给跟基线相比的计算成本明细。

术语

原文与代码

相关论文

全部论文解读