OPDSearch+:免微调教师蒸馏加 RL,小模型搜索推理超纯 RL

_reachsumit · x · 2026-08-26

arXiv 论文 OPDSearch+ 提出首个无需教师微调的搜索增强推理蒸馏范式。动机:SFT 收集多轮搜索轨迹太贵;现成教师做 on-policy 蒸馏又受教师性能上限约束且训练不稳。方法分两阶段:第一阶段让学生与真实搜索引擎交互,用逐位置 forward KL 从冻结的现成 instruct 模型蒸馏,迁移推理分解与证据整合能力;第二阶段用 RL 从更丰富的行为基础出发精炼。关键洞察:教师重塑了学生的策略分布,使后续 RL 收敛到纯 RL 达不到的更优解,在多跳问答上尤为明显。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →