弱教师交替CoT转给冻结Kimi,准确率抬了11.5点

Allspark: Weak to Strong Transfer via Alternating Chain of Thought

Kaizhao Liang, Junxiong Wang, Chen Liang, Zhendong Wang, Qiang Liu

cs.LG, cs.AI

2026-09-27

小模型训弱教师交替写思维链,推理时接冻结大模型。Inkling从78.1%到81.6%,Kimi+11.5点。

这篇在解决什么

在大模型上试一套 RL 配方,账单里最沉的往往是 rollout。长思维链要反复采样,算力不够的实验室连配方筛选都开不起。现成的迁移路径是先在小模型上学推理,再灌进大模型。Kimi K3、DeepSeek-V4 用的 on-policy distillation(OPD,对学生自己采样的轨迹做蒸馏)仍然要对学生采样、对学生更新。学生一旦是前沿规模,大模型 rollout 一分钱没省下来。

Allspark 换了问题:弱教师用 RL 学到的推理改进,训练阶段能不能完全不碰目标大模型的 rollout,只靠推理时的文本交接,让冻结的强学生答得更好。

方法

训练时用同一小模型的两份拷贝。一份是弱教师 π,用 RL 更新;另一份 ρ 从同一初始权重冻结,负责续写并给出最终答案。两边轮流往同一条思维链上追加一段。学生先写,教师再写,再轮换。推理结束时由学生出答案。只有教师写出的 token 进损失,学生 token 和分隔符全部 mask 掉。奖励只看最终答案对不对,中间推理没有过程奖励。训练时搭档冻结,是为了让教师习惯「对方不改权重、只靠文本接话」,和推理时强学生冻结同一设定。

教师一段话好不好,不看它自己能不能解完,看学生接完之后答对的期望。论文把这个量叫 continuation value Q(h, z)。类比是结对编程:弱的那个负责插话纠偏,强的那个负责收口。

迁移时教师冻结,把训练搭档换成更强的学生,两边都不再更新。交接面是共享文本,各自用自己的 tokenizer 编解码,所以跨模型族、跨词表都能接。教师不必单独解题更强,它的工作是写出对学生后续续写有用的片段。

Qwen 实验里教师从 Qwen3-1.7B 出发,只训 LoRA。Inkling 实验把同一套路做到 Inkling-Small(总参 276B,每 token 激活 12B),再迁到 Inkling(975B / 41B 激活)。

结果

Qwen 开发集每域 128 题、每题采样一次,教师固定为 checkpoint 94:

学生教师MathReasoning
Qwen3-1.7B无81.373.4
Qwen3-1.7B普通 RL88.271.8
Qwen3-1.7BAllspark89.875.0
Qwen3-1.7B(自身 RL)无89.870.3
Qwen3-4B无96.981.2
Qwen3-4B未训练93.079.7
Qwen3-4B普通 RL89.879.6
Qwen3-4BAllspark96.182.8

同尺寸上 Allspark 两个域都高于「学生独自」和「普通 RL 教师」。迁到 4B 时,未训练教师和普通 RL 教师两边都在拉低准确率;Allspark 在数学上 96.1 对独自的 96.9,几乎打平,推理上高 1.6 点。把弱模型直接接到强学生前面,默认是减分。必须专门为「给别人续写」而训。选出来的 4B 轨迹里,教师能把八边形面积从 1053/2 纠到 567,也能把错误的 tens 表写进学生代码。

尺度再放大,评测换到 ARC-AGI-2。1000 道公开训练题拆成 904/96,开发集 96 题、每题 3 次尝试。Inkling 独自最高 78.1%;配上训好的 Inkling-Small 教师后最高 81.6%。选一个工作点,Allspark 用 10.8k 保留 token 做到 79.2%,高于学生独自在 12.3k token 时的 78.1%。

同一教师冻着接到别的家族,论文只给了相对学生独自的差,没有绝对准确率:

学生准确率变化保留 token
Nemotron-3-Ultra medium+17.7 点+72.5%
Nemotron-3-Ultra full+5.2 点+4.4%
Kimi-K2.6(128K)+11.5 点-7.7%

更早的族内对照(checkpoint 35、effort 0.7、每题一次)方向一致:未训练教师把 Inkling 从 75.0% 拉到 66.7%,Allspark 教师到 76.0%。

同 thinking effort 下,Allspark 每次尝试的模型化成本是学生独自的 1.42-1.82 倍。上面那个 token 少 12.1% 的 Inkling 对比(10,771 对 12,253),成本只少约 2.7%($0.0606 对 $0.0623)。Kimi 上 token 少 7.7%,成本反而高 21.1%(约 $0.1466 升到 $0.1774)。少生成不等于少花钱:两次前缀、缓存重读、教师 token 的单价都会进来。

为什么重要

给训不起前沿模型的实验室一条可走的路:RL 配方和小模型数据先在弱教师上试,训完冻住,接到已经能 serve 的强学生上当推理插件。不改学生权重,也不对学生采样。跨 tokenizer 靠文本交接,比 token 级 OPD 省事。

它不是免费午餐。Qwen 4B 数学没有超过学生独自,ARC 增益随 thinking effort 会变,跨家族的 token 账有正有负。这更接近一个可复用的推理搭档,而不是把能力蒸馏进学生。学生权重没动,走的时候教师还得一起上线。

局限与存疑

论文自己写了三条。推理要同时 serve 教师和学生,额外调用和 handoff 会加延迟和费用,保留 token 下降推不出部署成本下降。实验覆盖的模型、任务、训练 run 都有限。实现依赖打断并续写共享推理流,非 thinking 模型、或不暴露推理通道的接口,还没有测。

另外几处读下来站得不稳。Qwen 数字来自用于选 checkpoint 的开发集,不是公开测试集,且每方法一粒种子。ARC 评的是公开训练拆出的 96 道开发题,不是官方测试。跨家族对比里,Allspark 会显式关掉推理通道再单独要答案,学生独自必须在一次 completion 里自己切到答案,协议并不对称。案例里教师也会把错索引表写进学生代码。Nemotron medium 的 +17.7 点伴随着 +72.5% token,增益有多少来自「写得更长」、有多少来自「写得更有用」,没有拆开。

术语

原文与代码

相关论文

全部论文解读