Learning from Teacher Continuations at Student States
Haojin Wang, Dylan Zhang, Huaibo Chen, Suhao Yu, Yihang Sun, Zhanyang Jin, Jiaying Ye, Dianqi Li, Prasanna Sattigeri, Kamal Youcef-Toumi, Hao Peng
cs.CL
2026-09-29
OLIVE每步让当前学生生成前缀、教师续写,只用交叉熵学教师文本。难推理pass@8相对原模型高6–8点;ScienceWorld上用GPT-5.4-mini文本比离线SFT高13%。
把强模型能力灌进弱模型,现在常用两条路。一条是拿教师轨迹做离线 SFT。另一条是 token 级 on-policy distillation(OPD):学生自己 rollout,教师在每个 token 上算 reverse-KL。
离线 SFT 有 sequential covariate shift:训练时条件在教师写过的前缀上,推理时条件在自己刚吐的 token 上,长链错误会滚。数据集还是死的,学生策略一变,监督就对不上它正在走的状态。OPD 把监督锚在学生自己的状态上,但后面的 target 仍条件在学生原先写错的后续上。教师就算想改某一个 token,后面也不会演示改完该怎么走。能力差距大、或多轮 agent 里学生早早走出教师支持集时,教师概率在那些状态上几乎没质量。匹配分布还要教师 logits,黑盒 API 直接出局。
OLIVE 要做的是:监督放在学生真正走到的状态上,并演示从那里如何继续。
OLIVE 是 OnLine InterVEntion。每一步三件事:
前缀每步重采,跟着还在变的学生走,接近 DAgger 里「在学习者自己的状态上问专家」。教师续写按自己的选择往下,所以能演示纠正之后的路径。loss 只用文本,双方 tokenizer 可以不同,黑盒教师也能蒸。续写可以截断、不必写完或通过 verifier,用来卡住在线教师的生成成本。
推理默认 k=4096、续写 M=1024,每条蒸馏 token 预算和基线对齐到 7168。Agent 上 ALFWorld、ScienceWorld 这类长环境学生先走 10 轮、教师最多接 5 轮;短环境学生 5 轮。前缀不筛选。
同步版学生要干等到教师写完才能更新。异步实现让下一批前缀采样和当前批教师续写重叠,用异步深度 d 卡住前缀策略和更新策略最多隔几次更新。推理实验取 d=3。
教师固定为 Qwen3-4B-Thinking-2507。RLVE 上选出学生很难的 18 个合成推理环境、共 9K 训练题,思考模式打开。对照里的 OPD 用 top-16 KL 近似。
| 学生 | 方法 | Pass@8 | Avg@8 |
| Qwen3-1.7B | 原模型 | 11.1 | 3.3 |
| Qwen3-1.7B | 离线教师轨迹 | 15.0 | 5.6 |
| Qwen3-1.7B | OPD | 14.4 | 4.6 |
| Qwen3-1.7B | OLIVE | 19.4 | 7.8 |
| Qwen3-4B | 原模型 | 46.1 | 18.1 |
| Qwen3-4B | 离线教师轨迹 | 53.3 | 19.9 |
| Qwen3-4B | OPD | 45.6 | 21.3 |
| Qwen3-4B | OLIVE | 52.2 | 23.5 |
OLIVE 的 avg@8 增益最大,1.7B 上 +4.5、4B 上 +5.4。4B 的 pass@8 上,未过滤离线教师轨迹是 53.3,OLIVE 是 52.2,离线略高一截。OPD 训练里学生与教师的 top-K 重叠几乎不动,大约从 0.707 到 0.713,token 级打分在思考行为对不上时推不动。
同一 9K 集、8×H200:OPD 花 41.3 GPU-hour,同步 OLIVE 39.1,异步 29.8。异步相对同步少 23.8% 时间,pass@8 从 54.4 降到 52.2。相对 OPD 大约少 28% GPU-hour,pass@8 高 6.6 点。
Agent 侧学生 Qwen3-1.7B、教师 Qwen3-32B,avg@4 成功率如下。
| 方法 | ALFWorld | ScienceWorld | TextCraft | BabyAI | SearchQA |
| 学生 | 19.38 | 0.12 | 23.00 | 38.33 | 30.50 |
| OPD | 22.25 | 0.00 | 29.50 | 43.06 | 29.56 |
| Guided OPD | 27.12 | 0.75 | 45.50 | 67.78 | 37.50 |
| OLIVE | 40.00 | 7.50 | 55.25 | 67.50 | 39.06 |
ScienceWorld 上学生接近 0,OPD 也拉不起来,OLIVE 到 7.5%。BabyAI 上 Guided OPD 67.78,OLIVE 67.50,其余四环境 OLIVE 最高。
只用 GPT-5.4-mini 文本时 OPD 接不上。ScienceWorld 上离线 SFT 两轮后平台期;OLIVE 前两轮更慢,5 个 epoch 后反超 13%。通用基准平均掉点:离线 SFT −3.4,离线前缀续写 OEC −1.3,OLIVE −0.9,测的是 AIME25、LiveCodeBench v6、IF-Eval、GPQA Diamond。五个 agent 环境按顺序连训,最后一个 ScienceWorld 上 OLIVE 比离线高 13.0 点。
SFT 的目标从「离线教师轨迹」挪到「当前学生走到的状态上的教师续写」,形式仍是交叉熵,接口仍是文本。API 教师可以直接当在线教练,不必 logits,也不必学生先走出一条能被教师打分的完整轨迹。
更对口的是两类场景:学生还写不出可靠长推理,以及多轮 agent 里早期错误会把整局带出教师分布。和 OPD 比,OLIVE 演示下一步;和离线 SFT 比,监督跟着策略刷新,平台期更晚、遗忘也更少。后面的任务还学得进。
代价是训练时要在线挂教师。异步把这段开销压到和 OPD 同量级,这批数字里甚至更低。
这是蒸馏设计轴上的渐进改进:监督放在哪、是否跟着学生刷新,和监督长什么样同样重要。目前没有和带奖励的 RL 做过对照。
稿面写着 Ongoing work,没有独立 Limitations 节。
异步用陈旧前缀换吞吐,d=3 时 4B 的 pass@8 掉 2.2 点。k 和 M 是固定超参,前缀不筛选,坏前缀教师也可能续不回来,这些选择没有系统扫描。ScienceWorld 的 7.5% 相对学生是跳跃,相对教师 15.62% 只到一半,离能用的 agent 还远。4B 推理 pass@8 还略低于未过滤的离线教师轨迹。主实验教师是同族 Qwen3;跨家族黑盒只做了 GPT-5.4-mini × ScienceWorld。没有和 RL 后训练直接比。RLVE 是无污染合成题,迁到自然考试题的幅度没给。