SearchArt: Training Long-Horizon Search Agent with Scalable Synthetic and Verified Task
Lang Mei, Xiaohan Yu, Chong Chen, Liyan Liu, Xiangnan Chen, Jinchao Ma, Chao Feng, Li Huang, Siyu Mo, Sichen Kang, Yunkun Xu, Zhihan Yang, Zhujun Xue, Jingren Zhang, Qing He, Yingdi Huang, Hao Jiang, Ziao Ma, Zewei Pan, Minhao Sun, Zhuo Tao, Jinzhao Xiao, Gangtao Xin, Huanyao Zhang, Wenjian Zhang, Jiangshan Zhang, Guojie Zhu, Jiaxin Mao, Wentao Zhang
cs.IR, cs.LG
2026-07-25
华为 SearchArt 用合成+验证任务管线训出 27B 搜索智能体,中文 BrowseComp 74.39 逼近 Gemini 3.1 Pro,五项基准平均 +13%。
让大模型当搜索智能体,自主完成需要多轮检索、多步推理的长程任务(深度搜索、深度研究),是这两年的热门方向。但训练这种智能体卡在两件事上:一是缺可扩展的长程任务数据,人工标注根本跟不上;二是中间的推理和工具调用对不对,很难评估和纠正。
华为云这篇 SearchArt 给了一套「合成任务 + 验证 + 后训练」的流水线,目标是只用 27B 参数,在深度搜索/研究基准上逼近闭源头部系统。
任务合成分几类:从网页文档和自动构建的「证据图」里合成信息检索问答和对应的搜索轨迹;把高质量综述、研究报告反过来推一个问题(答案是现成的长文);再加贴近真实用户的对话式、宽检索式问答。难度用证据图的拓扑复杂度和证据分散度排序,只留最难的。
关键是验证管线:合成出来的问答和轨迹要过三道关,问答一致性、轨迹质量、检索证据的相关性,过了才进训练集。
后训练分两段:SFT 教模型正确调工具、走流程,RL 再优化策略。奖励是混合制:结果奖励判最终答案对错(规则优先、判官模型兜底),过程奖励管格式和每轮推理预算,还专门做了个「自进化判官审计」来抓 reward hacking(模型学会骗奖励)。
底座是 Qwen3.5-27B。后训练后五项基准平均相对提升 13.16%:BrowseComp 61.0 到 70.06,BrowseComp-ZH 62.1 到 74.39,BrowseComp-Plus 58.43 到 63.49,WideSearch 61.1 到 64.0,DeepResearch-Bench 44.7 到 52.55。
最亮眼的是中文 BrowseComp-ZH 拿到 74.39,只比 Gemini 3.1 Pro(74.8)低 0.4 分,比 GPT-5.4(75.3)低 0.9。在所有 30B 级的开源搜索智能体里(MiroThinker、OpenSeeker、RedSearcher 等)明显最强。
| 基准 | 底座 Qwen3.5-27B | SearchArt-27B |
| BrowseComp | 61.0 | 70.06 |
| BrowseComp-ZH | 62.1 | 74.39 |
| BrowseComp-Plus | 58.43 | 63.49 |
| DeepResearch-Bench | 44.7 | 52.55 |
英文旗舰 BrowseComp 上,SearchArt 的 70.06 仍落后头部闭源一大截(Gemini 3.1 Pro 85.9、GPT-5.5 84.4),别被「匹敌闭源」的话术带偏。真正成立的是两件事:同尺寸小模型里它断档领先,中文和深度研究这两个基准上一个 27B 开源模型确实能摸到闭源前沿的下沿。对想自建搜索智能体的团队,这套「合成 + 验证」管线比标了多少分更值得抄。
英文 BrowseComp 的大幅落后说明,纯英文、需要广覆盖事实的硬检索,小模型加后训练还补不齐与闭源头部算力的差距。论文里大量分数标了星号(自行复现),和官方数字不完全可比。任务合成依赖强教师模型(Qwen3.5-397B 等)生成轨迹,验证管线本身又靠判官模型,「评估和检索是同一个难题」的循环没有真正绕开,只是用工程手段缓解。