免微调14B教师蒸馏加RL,3B多跳搜索问答EM超纯RL三成

OPDSearch+: On-Policy Distillation with RL Refinement for Search-Augmented Reasoning

Qinglin Ye, Zhiyuan Gu, Jingjie Xia, Yiheng Zhang, Kaiyan Zhao, Shunchao Zheng, Yuhang Mu, Wenchao Du, Yiming Wang

cs.AI

2026-08-25

冻结的14B Instruct教师对学生在线搜索轨迹做前向KL在策略蒸馏,再接GRPO精炼,3B模型七项问答均分EM达0.4402,HotpotQA比最强3B基线高出13.1%。

这篇在解决什么

小模型做搜索增强推理一直难。现有路线两条:一条是用强化学习(Search-R1这一路)让模型自己摸索何时搜、搜什么;另一条是把更大教师的轨迹蒸馏给学生。前者奖励稀疏,多跳任务上3B模型很难自己摸出子问题分解。后者更麻烦:高质量多轮搜索轨迹依赖实时检索结果,离线SFT数据几乎没法跨检索器和语料版本复用;若先把教师在任务上微调再蒸馏,教师训练本身就贵,直接拿现成Instruct模型当教师又容易把学生锁在教师天花板上,训练还不稳定。

OPDSearch+的主张很具体:冻结的现成Instruct教师不必当模仿上限。它的作用是把学生的策略分布重新铺开,好让后续强化学习走到纯RL到不了的解。

方法

学生是Qwen2.5-3B(base),教师是冻结的Qwen2.5-14B-Instruct。检索设置跟Search-R1对齐:E5-base-v2,2018年12月维基百科,每次返回top-3段落。训练数据是NQ加HotpotQA的训练集,大约17万条。

第一阶段,学生自己跟在线搜索引擎滚轨迹,交错输出思考、查询、读回段落、最终答案。每题8条轨迹,最多4轮搜索。教师只在学生自己生成的token上打逐位置对数概率,检索回来的段落做state masking,不进损失。蒸馏目标是逐位置前向KL,实现成带裁剪的重要性加权交叉熵:教师比学生更看好的token,梯度被放大,重要性权重裁到\([10^{-6}, 10]\)。另加一项相对初始checkpoint的KL,防止跑飞。

选前向KL是有意的。反向KL会在学生已经高概率的token上放大梯度,容易把熵压垮;前向KL的大权重落在学生很少采到的token上,梯度二阶矩有上界。对照实验里,JSD和对数比变体20步内出NaN,裁剪反向KL大约60步就退化,熵自适应反向KL能稳住,验证EM仍只有0.470,前向KL是0.493且能练过400步。

第二阶段丢掉教师,从OPD第150步checkpoint接GRPO,奖励是0.9倍Exact Match加0.1倍格式分。训练在veRL上,4张H200,学习率\(1\times 10^{-6}\)。全程大约48 GPU小时,和Search-R1量级相当。

结果

七项QA的均分Exact Match是0.4402,超过此前最强3B方法GiGPO-Instruct的0.421。

方法均分EMHotpotQA2Wiki
OPDSearch+(14B蒸馏再RL)0.44020.45800.4264
AutoRefine-Base0.4050.4050.393
GiGPO-Instruct0.4210.3690.370
复现纯RL0.35240.34670.3142
冻结14B教师直接评0.39850.39160.3513
只做OPD、不做RL0.36550.36020.3281

HotpotQA相对AutoRefine-Base高13.1%,2Wiki高8.5%。多跳是拉开差距的地方:纯RL单跳均分0.514已经能打,HotpotQA只有0.347、2Wiki只有0.314;OPD再RL把这两项拉到0.458和0.426。学生最终均分也高于冻结14B教师的0.3985。离线SFT再RL是0.4185,仍低一截。OPD和RL一起优化只有0.3660,两个目标互相干扰。

策略层面,OPD把进入RL时的熵从基座的0.82抬到1.35,平均搜索轮次从3.5降到2.7。Bamboogle是例外:GiGPO拿到0.641,本方法0.456,该集只有125条。

为什么重要

对要在小模型上训搜索agent的人,这篇给了一条可复用的顺序:先用现成大Instruct模型做在策略前向KL,再RL。不必先把教师在检索任务上微调,也不必囤多轮搜索SFT数据。多跳上的增益说明,子查询分解这种行为用蒸馏搬过来,比让3B自己从稀疏EM里摸更省。代价上跟纯RL同一量级。

这是渐进改进,不是新交互协议。骨架仍是Search-R1的工具循环和GRPO,变的是初始化。

局限与存疑

第二阶段RL仍然会崩,论文写到观察到collapse就停。蒸馏把初始化变好了,没有取消outcome RL的不稳。Bamboogle上明显弱于GiGPO,且样本量太小,不宜当成多跳通吃的证据。评测绑定2018维基加E5,不是开放网页。反向KL变体在同一超参下崩,换一套超参也许能救,论文没穷尽。教师尺度只试了7B和14B,学生固定3B。

术语

原文与代码

社区讨论

相关论文

全部论文解读