Iris: Climbing to the Search Frontier
Ziyuan Liu, Hengqi Liu, Zichuan Wang, Yang Qin, Jiachen Liang, Xu Chu, Shaowei Chen, Yuantao Gu, Mu Chuan
cs.AI
2026-09-04
AllSpark 从网页超链接反构多跳搜索题,再交替做过滤 SFT 与在线搜索 RL。开启上下文管理后,Iris-mini / Iris-pro 在 BrowseComp 上分别打到 82.2 和 88.6,同档开源整体最强。
搜索 agent 的排行榜涨得很快,但分数经常分不清是策略变强了,还是推理时的上下文管理(context management, CM)把超时轨迹救回来了。长程搜索会把上下文吃满,现有系统用摘要、裁剪或整段清空来续跑,增益可以到十几分。只报带 CM 的数字,会把 harness 的贡献算到模型头上。
AllSpark 给出一套从造题、过滤轨迹、到 SFT 与在线搜索 RL 交替的配方,并坚持每个基准都同时报「有 CM / 无 CM」。产品是 Iris-mini(Qwen3.6-35B-A3B)和 Iris-pro(Qwen3.5-397B-A17B),工具只有 search 和 scrape,单 ReAct,没有子代理,也没有测试时再验证。
题不是从网上随便捞的。流程从网页超链接图反着走:种子页扩出局部子图,抽成实体关系图,再写至少 N 跳的问题。每个非答案实体都被改写成描述性指称,名字和别名都拿掉,堵住「搜原词就能中」的捷径。准入要同时过两道门:参考模型闭卷答不对,但把证据图喂进去就能答对。
教师用 ReAct 对着在线搜索滚轨迹。粗过滤要求答对、不退化(滑动窗口压缩比抓循环)、工具调用次数够深;细过滤用 LLM 给单轮打 keep/mask,一条轨迹最多 mask 10% 的 assistant 轮,被 mask 的轮仍留在上下文里但不进 loss。
RL 对着 live search 做 group-relative 策略梯度。超长 rollout 在 request 级打断,下一 step 从已提交前缀续跑,用 truncated importance sampling 修不同权重版本拼出来的轨迹。奖励裁判和页面摘要器都是集群里的 Qwen3.5-397B-A17B FP8 引擎,不调外部 API。SFT-RL climbing 把每轮 RL 里「能解但不稳」(组内通过率落在 (0, 1/2]) 且工具调用够深的最短成功轨迹送回下一轮 SFT,难度跟着策略自己往上走。
主结果默认 discard-all:上下文满了就清空历史、同一题重开,这是 DeepSeek-V3.2 那套。
| 模型 | BrowseComp | BrowseComp-ZH | DeepSearchQA | HLE |
| XYZ-Aquila-mini 35B | 78.8 | 82.9 | 89.5 | 51.1 |
| Iris-mini 35B | 82.2 | 84.8 | 86.9 | 52.3 |
| XYZ-Aquila-pro 397B | 84.8 | 85.1 | 92.5 | 53.3 |
| Iris-pro 397B | 88.6 | 85.1 | 92.9 | 56.4 |
没有 CM 时 Iris-mini 在 BrowseComp / BrowseComp-ZH 上是 64.7 / 72.3,仍高于 FORT-Searcher 的 55.9 / 62.1。加上 discard-all 后 BrowseComp 再涨 17.5 分到 82.2;再叠 retry 到 85.9。Iris-pro 无 CM 是 72.6 / 76.8,discard-all 后 BrowseComp 88.6,retry 后 90.3。
CM 对 BrowseComp 最值钱,对 HLE 少得多。Iris-mini 的 HLE 无 CM 基线是 43.2,最多再涨约 9 分,因为瓶颈在专家推理,不在上下文被撑爆。BrowseComp-ZH 上三种配置都停在 85.1(289 题里 246 题对),附录指出官方答案和剧情对不上的标注问题。
这是一份把数据、训练和评测拆开写清楚的开源搜索 agent 配方,而且愿意把无 CM 数字摆上台面。35B 的 Iris-mini 在 BrowseComp 上已经靠近 Kimi-K2.6 的 83.2 和 DeepSeek-V4-Pro 的 83.4。做搜索系统的人如果只盯带 CM 的榜,会高估策略本身。
权重和配方计划开源。搜索数据和搜索教师还被观察到能正向迁移到通用工具使用和办公任务,但正文没给具体分数。
跟最强闭源或重计算系统仍有缺口:Kimi-K3 的 BrowseComp 是 91.2,Apodex-1.0-H 是 90.3,Claude Fable 5 的 HLE 是 64.5。retry 能再抬分,代价是整段重搜,作者自己也不把它当主报配置。climbing 的若干超参写了「细节以后再发」。单次 pass@1 加 LLM judge,再加上 BrowseComp-ZH 的标注噪声,同档比较时差几个点要保守看。