跨分词器蒸馏长思考能力,Intern-S2 靠文本对齐补 21 分逼近 Gemini-2.5-Pro

SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning

Haonan He, Haodi Lei, Yun Luo, Haoran Zhang, Shunkai Zhang, Yizhuo Li, Shengji Tang, Zhilin Wang, Runzhe Zhan, Lei Bai, Ganqu Cui, Fangchen Yu, Yafu Li, Peng Ye, Ning Ding, Yu Cheng

cs.CL, cs.AI

2026-08-14

SimpleOPD 靠对齐文本片段绕开分词器不同的难题,让 Intern-S2-Preview 在 ProofBench 上从 21.7 分升到 44.5 分,逼近教师模型。

这篇在解决什么

在策略蒸馏(OPD)已经被证明能有效把推理能力从强模型传给弱模型,但前提是师生共用一套分词器,这样才能逐 token 对比两边的概率分布。可现实中最强的推理模型往往和目标学生模型不是同一家族:分词器不同,上下文长度也不同。论文聚焦一个具体又棘手的场景:把长上下文数学证明模型 SU-01(30B)的推理能力,蒸馏给短上下文、不同分词器的学生模型(Qwen3.5、Intern-S2、GLM-4.7、Gemma-4 等)。直接硬蒸馏会出问题,学生输出长度失控暴涨、频繁被截断、训练不稳定,尤其是学生总学不会正确吐出终止符 </think>、<|imend|>。

方法

核心思路是把对齐从 token 级挪到文本级。学生按自己的分词器生成回复,拿到回复的文字表面串之后,再用老师自己的分词器和对话模板重新编码这段文字,老师给出的是它「原生」的 token 序列。两边的 token 未必一一对应,但都是同一段文本切出来的片段。论文用双指针扫描,只要学生 token 和老师 token 覆盖的文字起止位置完全重合,就判定这两个 token「对齐」,可以直接把老师在这个位置的 log 概率当作监督信号;覆盖不上的位置就退化成用学生自己的概率(相当于不提供额外监督)。这样完全不需要师生共享词表,靠「文字片段相同」这一个弱假设就能建立起可用的 token 级监督。

光是这样还不够。直接跑蒸馏,学生输出长度会随训练不断膨胀,而且越来越难正确终止。论文加了两个稳定手段:一是把结构性终止 token(</think>、<|imend|>)的优势值屏蔽掉,不强迫学生的终止行为完全学老师;二是加一个学生自身参考策略的 KL 正则项,把学生策略约束在初始策略附近的信任域内,防止训练发散。两者叠加后,截断率被压到接近零。

结果

模型ProofBench@4AnswerBench@8AIME25@8
SU-01(教师,30B)45.0077.5094.60
Intern-S2-Preview(基座)21.7076.0388.33
Intern-S2-OPD(SimpleOPD 后)44.50(+22.80)80.10(+4.07)95.00(+6.67)

Intern-S2-OPD 的 ProofBench 分数几乎追平教师模型 SU-01(44.50 对 45.00),AnswerBench 和 AIME25 甚至反超教师。用 Gemini-2.5-Pro 当裁判的独立评测中,Intern-S2-OPD 从 34.0 分提升到 55.2 分,超过 GPT-5 和 Gemini-2.5-Pro,只落后 SU-01 和 DeepSeek-V3.2-Speciale。这个方法同样适用于同分词器场景:Qwen3-4B-OPD 在 ProofBench 上涨 12.30 分。消融显示两个稳定手段缺一不可,只做终止符屏蔽仍无法完全遏制长度膨胀,加上参考 KL 之后截断率才真正压到接近零。跨家族实验(GLM-4.7、Gemma-4)显示分词器差异越大迁移效果越弱:GLM(同为 BPE)两个基准都有提升,Gemma(SentencePiece,词表结构差异大)在 AnswerBench 上反而掉了 1.3 分。训练数据只有数学证明题,但学到的推理能力泛化到了 HLE、HiPhO 这类跨领域科学推理基准上(HiPhO 从 38.6 涨到 41.1),说明蒸馏传递的不只是数学套路。

为什么重要

对想用强推理模型给自家短上下文模型「输血」但两者不同家族的团队,这提供了一条不用共享词表就能做 token 级蒸馏的实操路径,而且额外说明了两个容易被忽视的稳定性坑:终止符会被老师的长输出带偏,以及不加正则的话策略会越训越发散。这两个坑一旦踩上,表现为「分数看着在涨,但输出越来越长越来越不稳定」,论文的案例研究里甚至出现学生模型陷入 972 次自我重复检查、或者退化成单 token 死循环的极端情况。这类问题很容易在只看分数曲线时被忽略。

局限与存疑

跨家族实验只测了两个模型(GLM-4.7、Gemma-4),且已经显示分词器差异大时收益变小甚至转负,更极端的架构差异(比如非 BPE 类分词器)下这套方法还能不能用没有验证。所有实验的教师都是同一个 SU-01(数学证明专精模型),蒸馏的能力域也局限在数学证明,论文自己承认「较长的蒸馏序列对复杂多步证明更重要」,但没有测试蒸馏其他类型的长程推理(比如 agentic 任务)是否也需要类似的调整。另外文本级对齐依赖两边解码出的表面字符串完全一致,如果老师和学生对同一段文本有不同的规范化处理(比如空格、Unicode 归一化),对齐会静默失败退化为无监督位置,论文没有讨论这种边界情况的发生频率。

术语

原文与代码

社区讨论

相关论文

全部论文解读