OPDSearch+:免微调教师蒸馏加 RL,小模型搜索推理超纯 RL
_reachsumit · x · 2026-08-26
arXiv 论文 OPDSearch+ 提出首个无需教师微调的搜索增强推理蒸馏范式。动机:SFT 收集多轮搜索轨迹太贵;现成教师做 on-policy 蒸馏又受教师性能上限约束且训练不稳。方法分两阶段:第一阶段让学生与真实搜索引擎交互,用逐位置 forward KL 从冻结的现成 instruct 模型蒸馏,迁移推理分解与证据整合能力;第二阶段用 RL 从更丰富的行为基础出发精炼。关键洞察:教师重塑了学生的策略分布,使后续 RL 收敛到纯 RL 达不到的更优解,在多跳问答上尤为明显。
「研究」频道最新
- LLM 如何在生成中途自我修正?揭秘背后的推理与指令机制 — dejanseo · 2026-08-26
- 智利大学出书探讨 Maturana 理论在 AI 领域的现时有效性 — PolarBearby · 2026-08-26
- ECCV 2026 新研究:Face Anything 实现任意序列 4D 人脸重建 — rsasaki0109 · 2026-08-26
- 日企将在 ECCV 2026 共办 FOUND 研讨会聚焦基盘数据 — HirokatuKataoka · 2026-08-26
- Gemini 3.7 Flash 助力复活 CMA-ES 算法解释网站 — doodlestein · 2026-08-26
- 从 PDE 数值模拟到神经模拟器及回归:博士论文 — chaumian · 2026-08-26