On-Policy Self-Distillation without Any Supervision
Yijiang Li, Bingyang Wang, Yijun Liang, Yunjie Tian, Di Fu, Nuno Vasconcelos
cs.LG
2026-08-07
U-OPSD 对模型自己的多个采样做多数投票造出伪答案,再蒸馏回错误推理,完全不需要标准答案或奖励,在 Qwen3 数学上比有监督的 OPSD 平均高 2-3 个点。
on-policy(同策略)蒸馏这类后训练方法对大模型很有用,但现有做法都离不开外部监督。OPSD 要把标准答案喂给 teacher 当特权上下文,GRPO 要可验证奖励,还有的依赖一个更大的 teacher 模型。在数学竞赛、代码这种有标准答案的领域还好办,换成没有标准答案的任务就抓瞎。
真正的问题是:模型能不能完全靠自己、不借助任何外部信号,就把推理能力练上去?这篇给出的答案是能。
U-OPSD 的核心是用「内部一致性」替代外部监督,整条流程只靠模型自己的采样:
关键设计在于蒸馏只针对模型「自信地错了」的地方。多次采样多数同意一个答案,说明对这个答案有信心;可同时少数 rollout 算错了,这些错处正是该修的。把正确推理路径塞回错误推理的前缀,等于让模型在出错的确切位置自我纠正。
几个工程细节也关键:teacher 用最短的正确 rollout,短推理往往更干净;散度默认算在整个词表上(57.1),消融显示截到 top-100 反而最高(59.0),只算学生采样的那一个 token 则崩到 43.5;目标函数用前向 KL,反向 KL 直接训练发散。
五个数学竞赛基准(AIME24、AIME25、HMMT25、MATH500、AMC23),非思考模式:
| 模型 | base | +OPSD(有监督) | +U-OPSD(无监督) |
| Qwen3-4B | 40.96 | 46.29 | 49.49 |
| Qwen3-8B | 43.57 | 52.04 | 54.31 |
U-OPSD 比 base 平均高 8.5(4B)和 10.7(8B)个点,比吃标准答案的 OPSD 还高 3.2 和 2.3 个点。零监督打赢了有监督的基线。
对比其他无监督方法(TTRL、RENT、Intuitor),U-OPSD 在 4B 上平均高约 7 个点、8B 上高约 11 个点。
思考模式下增益缩水:4B 上 U-OPSD 77.05,比 OPSD 高 0.85;8B 上 77.99,与 OPSD(77.97)基本持平。作者解释,思考模式 base 已经很强,多数投票复现的就是那个已经不错的答案,提升空间自然小。
对没有标准答案的任务(开放问答、长文写作、对话),这等于打开一条不依赖奖励模型、不依赖人工标注、也不依赖更大 teacher 的训练路径。能用多数投票的地方就能用 U-OPSD。它把「自蒸馏」从名义上的 self 变成真正的 self:teacher 和 student 是同一个模型,特权上下文也是模型自己造的,没有任何外部信号进场。
天花板也真实存在:多数投票复现的是 base 模型最常见的答案,base 本身不会的题,投票也投不出对的。
作者自己承认几条。一是只在 Qwen3 一个模型族、竞赛数学一个领域上验证,泛化到其他任务和模型还缺证据。二是增益强烈依赖模式,非思考模式大赢,思考模式几乎打平 OPSD。三是伪标签里实测有 13.3% 是错的,多数投票本质上被 base 的能力封顶。四是每套训练设置都还缺多次随机种子的误差棒。
还有一个存疑:思考模式下几乎没增益,恰恰说明这套方法在模型已经很强时退化为轻微微调。那么它在更小、更弱的模型上是不是反而更值钱,论文没单独拆出来讲。