学生前缀上让教师续写,OLIVE在线蒸馏ScienceWorld比离线SFT高13%

Learning from Teacher Continuations at Student States

Haojin Wang, Dylan Zhang, Huaibo Chen, Suhao Yu, Yihang Sun, Zhanyang Jin, Jiaying Ye, Dianqi Li, Prasanna Sattigeri, Kamal Youcef-Toumi, Hao Peng

cs.CL

2026-09-29

OLIVE每步让当前学生生成前缀、教师续写,只用交叉熵学教师文本。难推理pass@8相对原模型高6–8点;ScienceWorld上用GPT-5.4-mini文本比离线SFT高13%。

这篇在解决什么

把强模型能力灌进弱模型,现在常用两条路。一条是拿教师轨迹做离线 SFT。另一条是 token 级 on-policy distillation(OPD):学生自己 rollout,教师在每个 token 上算 reverse-KL。

离线 SFT 有 sequential covariate shift:训练时条件在教师写过的前缀上,推理时条件在自己刚吐的 token 上,长链错误会滚。数据集还是死的,学生策略一变,监督就对不上它正在走的状态。OPD 把监督锚在学生自己的状态上,但后面的 target 仍条件在学生原先写错的后续上。教师就算想改某一个 token,后面也不会演示改完该怎么走。能力差距大、或多轮 agent 里学生早早走出教师支持集时,教师概率在那些状态上几乎没质量。匹配分布还要教师 logits,黑盒 API 直接出局。

OLIVE 要做的是:监督放在学生真正走到的状态上,并演示从那里如何继续。

方法

OLIVE 是 OnLine InterVEntion。每一步三件事:

前缀每步重采,跟着还在变的学生走,接近 DAgger 里「在学习者自己的状态上问专家」。教师续写按自己的选择往下,所以能演示纠正之后的路径。loss 只用文本,双方 tokenizer 可以不同,黑盒教师也能蒸。续写可以截断、不必写完或通过 verifier,用来卡住在线教师的生成成本。

推理默认 k=4096、续写 M=1024,每条蒸馏 token 预算和基线对齐到 7168。Agent 上 ALFWorld、ScienceWorld 这类长环境学生先走 10 轮、教师最多接 5 轮;短环境学生 5 轮。前缀不筛选。

同步版学生要干等到教师写完才能更新。异步实现让下一批前缀采样和当前批教师续写重叠,用异步深度 d 卡住前缀策略和更新策略最多隔几次更新。推理实验取 d=3。

结果

教师固定为 Qwen3-4B-Thinking-2507。RLVE 上选出学生很难的 18 个合成推理环境、共 9K 训练题,思考模式打开。对照里的 OPD 用 top-16 KL 近似。

学生方法Pass@8Avg@8
Qwen3-1.7B原模型11.13.3
Qwen3-1.7B离线教师轨迹15.05.6
Qwen3-1.7BOPD14.44.6
Qwen3-1.7BOLIVE19.47.8
Qwen3-4B原模型46.118.1
Qwen3-4B离线教师轨迹53.319.9
Qwen3-4BOPD45.621.3
Qwen3-4BOLIVE52.223.5

OLIVE 的 avg@8 增益最大,1.7B 上 +4.5、4B 上 +5.4。4B 的 pass@8 上,未过滤离线教师轨迹是 53.3,OLIVE 是 52.2,离线略高一截。OPD 训练里学生与教师的 top-K 重叠几乎不动,大约从 0.707 到 0.713,token 级打分在思考行为对不上时推不动。

同一 9K 集、8×H200:OPD 花 41.3 GPU-hour,同步 OLIVE 39.1,异步 29.8。异步相对同步少 23.8% 时间,pass@8 从 54.4 降到 52.2。相对 OPD 大约少 28% GPU-hour,pass@8 高 6.6 点。

Agent 侧学生 Qwen3-1.7B、教师 Qwen3-32B,avg@4 成功率如下。

方法ALFWorldScienceWorldTextCraftBabyAISearchQA
学生19.380.1223.0038.3330.50
OPD22.250.0029.5043.0629.56
Guided OPD27.120.7545.5067.7837.50
OLIVE40.007.5055.2567.5039.06

ScienceWorld 上学生接近 0,OPD 也拉不起来,OLIVE 到 7.5%。BabyAI 上 Guided OPD 67.78,OLIVE 67.50,其余四环境 OLIVE 最高。

只用 GPT-5.4-mini 文本时 OPD 接不上。ScienceWorld 上离线 SFT 两轮后平台期;OLIVE 前两轮更慢,5 个 epoch 后反超 13%。通用基准平均掉点:离线 SFT −3.4,离线前缀续写 OEC −1.3,OLIVE −0.9,测的是 AIME25、LiveCodeBench v6、IF-Eval、GPQA Diamond。五个 agent 环境按顺序连训,最后一个 ScienceWorld 上 OLIVE 比离线高 13.0 点。

为什么重要

SFT 的目标从「离线教师轨迹」挪到「当前学生走到的状态上的教师续写」,形式仍是交叉熵,接口仍是文本。API 教师可以直接当在线教练,不必 logits,也不必学生先走出一条能被教师打分的完整轨迹。

更对口的是两类场景:学生还写不出可靠长推理,以及多轮 agent 里早期错误会把整局带出教师分布。和 OPD 比,OLIVE 演示下一步;和离线 SFT 比,监督跟着策略刷新,平台期更晚、遗忘也更少。后面的任务还学得进。

代价是训练时要在线挂教师。异步把这段开销压到和 OPD 同量级,这批数字里甚至更低。

这是蒸馏设计轴上的渐进改进:监督放在哪、是否跟着学生刷新,和监督长什么样同样重要。目前没有和带奖励的 RL 做过对照。

局限与存疑

稿面写着 Ongoing work,没有独立 Limitations 节。

异步用陈旧前缀换吞吐,d=3 时 4B 的 pass@8 掉 2.2 点。k 和 M 是固定超参,前缀不筛选,坏前缀教师也可能续不回来,这些选择没有系统扫描。ScienceWorld 的 7.5% 相对学生是跳跃,相对教师 15.62% 只到一半,离能用的 agent 还远。4B 推理 pass@8 还略低于未过滤的离线教师轨迹。主实验教师是同族 Qwen3;跨家族黑盒只做了 GPT-5.4-mini × ScienceWorld。没有和 RL 后训练直接比。RLVE 是无污染合成题,迁到自然考试题的幅度没给。

术语

原文与代码

相关论文

全部论文解读