Latent On-Policy Self-Distillation
Guibin Zhang, Jiayang Lyu, Ran Sun, Xinlei Yu, Haoyu Zhao, Qibing Ren, Shuicheng Yan
cs.LG, cs.CL
2026-08-13
把检索到的成功轨迹压成 96 个可学习潜 token 供冻结教师使用,联合优化压缩器与学生,十组对照全部第一,三成 rollout 预算即超过 GRPO。
在线自蒸馏(OPSD)是近一年 agent 后训练的热门配方:学生模型自己在环境里 rollout,另一个同源实例当教师,教师在额外「特权上下文」(答案、参考轨迹、环境反馈)条件下重估学生走过的每个前缀,给出逐 token 分布,学生用 KL 散度对齐。相比 GRPO 这类只拿最终结果奖励的 RL,信号密;相比请更强模型当教师,不依赖外部模型。
卡点在特权上下文本身。现有方法都由人规定教师看什么:OPSD 塞一条 oracle 轨迹,SDPO 用同组成功兄弟 rollout,Skill-SD 给蒸馏出的技能摘要。这些格式在某些设置下有效,换个基准就翻车。论文的对照数据很直接:Qwen3-4B 上,SDPO 在 BFCL-v3 把分数从 22.88 拉低到 15.75,ACEBench 从 50.6 掉到 38.0;OPSD 在 LiveCodeBench 上拿 40.24,低于不训练的 45.61。加了特权信息反而更差,说明「给教师看什么」这个设计决策从未被优化过。
LOPD 把特权上下文从人工格式改成可学习的连续潜表示,其余训练循环照旧。流程:
真正难的不是压缩,是堵住一条作弊路径:压缩器可以把潜 token 学成让教师分布逼近学生分布,蒸馏损失照样下降,学生却什么都没学到。LOPD 用特权裕度约束堵它:定义每个动作 token 上教师 log-prob 减学生 log-prob 的差值 δ,按轨迹结果奖励(成功 +1、失败 −1)加权平均成 Δ,要求 Δ 不低于 m=0.05,用对偶变量 β 逐级加压;另加一项锚定损失防止潜表示漂离冷启动初始化。压缩器先在「检索经验→成功轨迹」对上做 NLL 冷启动,再进联合优化。
消融证明这个约束决定成败:冻结压缩器训练得 0.573;m=0(无约束)掉到 0.551,比冻结还差,直接证实塌缩路径存在;m=0.05 时到 0.637;m=0.20 又回落到 0.613。
三个 backbone(Qwen3-4B/8B、Olmo3-7B)、七个基准,十组聚合全部第一:
| 设置 | 最强基线 | LOPD |
| EnvScaler · Qwen3-4B | GRPO 61.8 | 63.7 |
| BFCL-v3 · Qwen3-4B | GRPO 25.25 | 27.38 |
| ACEBench · Qwen3-4B | GRPO / Skill-SD 56.0 | 60.6 |
| EnvScaler · Qwen3-8B | Skill-SD 60.2 | 66.4 |
| LiveCodeBench · Olmo3-7B | SDPO 49.82 | 50.98 |
| EvalPlus · Qwen3-4B | SDFT 80.07 | 81.36 |
十组设置全部高于不训练的基线,增益从 1.50 分(BFCL-v3 · Qwen3-8B)到 17.2 分(EnvScaler · Qwen3-8B)。
样本效率是最亮眼的一块。1600 代 rollout 预算下,LOPD 在 320 代即超过 0.61 平均奖励,576 代到 0.637 后走平;GRPO 跑满全程只有 0.611,Skill-SD 0.588。论文口径是「不到三成预算超过 GRPO 与 Skill-SD 的最终成绩」,训练曲线支撑这个说法。
容量与检索都有阈值:每条经验 8 或 16 个潜 token 时奖励停在 0.56 附近,32 个跳到 0.637,64/128 无一致增益;检索 1 条 0.605,3 条 0.637,继续加不涨。
行为层面的变化比分数更有说服力。训练后的学生环境步数从 11.12 升到 17.04,每步工具调用从 3.50 降到 1.11,首步响应短了 37.5%,重复调用从 8.89 降到 5.25,单次调用奖励从 0.038 升到 0.050。从「一步甩一把投机调用」变成「顺序执行计划」,且这些模式在推理时不带任何特权上下文仍然保留。
对做 agent 后训练的人,价值有三层。第一,训练完的学生零推理开销:经验库、检索、压缩器只在训练期存在,部署形态与原模型一致,跳开了 RAG/记忆类方案把检索堆进推理链路的成本。第二,样本效率数据对 rollout 昂贵的多轮环境是实打实的省钱。第三,它给 OPSD 家族换掉了地基:固定格式的特权上下文跨设置时会反噬,可学习表示才是稳定的那一层,这个结论有塌缩消融直接支撑,不是叙事。
定位也要说清:这是 OPSD 路线内的底座改造,不是新范式;相比 GRPO 的增益多数在 15 分,属于渐进改进,大的跳变(EnvScaler +17.2)集中在工具使用场景。Qwen3-8B-LOPD 与 Olmo3-7B-LOPD 权重及代码已开源。
论文自己承认的一点:潜 token 过 LM head 投影出来是多语言与代码碎片的混合,任务条件只改变表面投影,读不出可复述的步骤;可解码性不能证明教师功能上用了哪些信息。案例研究只看了 10 个工具任务加 10 个编码任务,规模很小。
读下来还有几处存疑。部分基准的增益贴着噪声:EvalPlus 上 Olmo3-7B 只比最强基线高 0.55 分,BFCL-v3 上 Qwen3-8B 只高 0.88 分。特权裕度需要轨迹级结果奖励 A=2r−1,没有 verifier 的开放域任务用不了。训练依赖冷启动、锚定、对偶变量三组超参(m、λ、ηβ),复现调参成本不低。教师 backbone 全程冻结,学生的进步不会反哺教师,引言里「持续自我改进」目前没有跨迭代实验支撑。规模止步于 4B8B、两个训练域,更长程任务未验证。