搜索 agent 自我蒸馏:DeepSearch-World 不靠强老师,BrowseComp 拿到 31.2

DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment

Xinyu Geng, Xuanhua He, Sixiang Chen, Yanjing Xiao, Fan Zhang, Shijue Huang, Haitao Mi, Zhenwen Liang, Tianqing Fang, Yi R. Fung

cs.CL

2026-07-09

DeepSearch-World 造了一个确定性、可验证的离线搜索环境(42 万条多跳问答),让 9B 模型不蒸馏更强模型、只从自己验证过的轨迹里迭代学习,BrowseComp 到 31.2%、GAIA 到 61.5%,比骨干 Qwen3.5-9B 涨 23.8 个点。

这篇在解决什么

让工具型 agent 从自己的经验里变强,有两条老路,各有各的死结。一条是 SFT,蒸馏骨干模型自己产的正向轨迹,但几轮就饱和,天花板被骨干能力和轨迹多样性卡死。另一条是稀疏奖励的 RL(如 GRPO),奖励只在轨迹终点给一次,至于失败是出在 query 写错、工具选错、证据抽错还是答案拼错,它一概不说。On-policy 自蒸馏(OPSD)想用细粒度的 token 级监督缓解稀疏,但 agent 的细粒度监督藏在每一次工具调用里,需要确定性的环境才能保证每一步的 teacher 分布不抖。DeepSearch-World 给的就是这个确定性环境。

方法

DeepSearch-World 是建在离线维基百科语料上的确定性、可验证环境,搜索和浏览工具都可复现,每一步工具调用的进度能做实体级验证。它从实体级随机游走构造了 42 万条多跳问答,还显式支持三种对自我进化有用的认知行为:进度验证、有依据的反思、失败恢复。

在此之上是 DeepSearch-Evolve 自蒸馏框架。关键是一套脚手架式的过程监督:teacher 在 rollout 时显式追踪进度、证据、失败尝试和恢复,把这些过程信号写进轨迹。但脚手架只在生成轨迹时用,训学生时不能暴露,于是做 scaffold-to-ReAct 转换,把脚手架诱导出的规划、记忆、纠错蒸馏进标准 ReAct 格式。每轮生成 1 万条轨迹,4000 条通过拒绝采样和质量过滤后触发一次训练,轨迹生成长度上限 30 步。整个流程迭代 11 轮,骨干是 Qwen3.5-9B,最后还在 1600 条真实工具实例上补了一轮 GRPO 来缩小离线到真实的差距。

结果

七个深度搜索和推理基准上,DeepSearch-World-9B 不蒸馏更强模型,只从自己环境验证过的 rollout 学:

基准分数
BrowseComp31.2%
GAIA61.5%
HotpotQA93.4%

和骨干 Qwen3.5-9B-Instruct 同工具设置下全面上涨:BrowseComp +23.8、GAIA +37.6、HotpotQA +48.1。行为差异很大:骨干平均 4.7 轮就草草收尾交答案,DeepSearch-World 能撑 18.0 轮,visit 调用从 0.9 次涨到 5.4 次,先进能力分从 19% 涨到 70%。消融里拒绝采样是主贡献(SearchQA 46.4 涨到 54.9),加上质量过滤再到 58.2;去掉反思改写会掉到 16.7,因为原始反思里带 [REFLECTION] 之类 artifact 会污染 think 分布。42 万样本比 10 万样本能到更高的验证平台,说明自我进化靠的是数据池多样性,不是反复曝光。

为什么重要

对做 agent 自我进化的团队,这篇的核心可迁移点是:可验证的确定性环境能替代一部分原本要靠更强 teacher 或外部合成管线提供的监督。它把「agent 从自己经验里学」这条路从「SFT 几轮就饱和」推进到了能稳定迭代 11 轮、还能跨基准泛化的程度。脚手架只在生成时用、训练时转成 ReAct 这个分离设计,对其他长程工具任务也直接可借鉴。

局限与存疑

环境建在维基百科上,覆盖面和领域多样性受限,换到更广的知识源效果如何没验证。更新规则用的是迭代 SFT,论文自己承认 RL 式或 OPSD 式的更新可能更强,但怎么把规划、纠错、工具策略这些高层能力注进 RL 训练还没摸清。BrowseComp-ZH 分数低是预期的,因为训练只用英文轨迹,跨语言只算部分迁移。scaffold teacher 本身依赖一个较强的骨干来产出高质量轨迹,所谓「不蒸馏更强模型」严格说是「不直接用更强模型的轨迹」,但能产出好轨迹的骨干仍是个前提。

术语

原文与代码

相关论文

全部论文解读