按线索拆检索再整题重排,GPT-5.5 深研准确率从 83.1% 升至 90.5%

Question's Gambit: The First Move Matters in Agentic Deep Search

Radin Hamidi Rad, Amin Bigdeli, Negar Arabzadeh, Sajad Ebrahimi, Charles L. A. Clarke, Benjamin C. M. Fung, Ebrahim Bagheri

cs.AI, cs.CL, cs.IR

2026-09-13

把复杂问题拆成线索分别检索再按整题重排,给深度研究 agent 一份热启动上下文。接到 Pi-Serini 上,GPT-5.5 在 BrowseComp-Plus 的答题准确率从 83.1% 升至 90.5%。

这篇在解决什么

深度研究 agent 用 ReAct 循环交替搜索、阅读和推理,一道 BrowseComp-Plus 题可以花几十次工具调用。这类题和 HotpotQA 那种「先查 A 再查 B」的线性多跳不同:答案藏在一组异构线索后面,日期、地点、职称、合著者、播出集数各自约束同一个未知实体,证据往往散落在不同文档里。

Pi-Serini 已经证明,BM25 挖得够深,gold 文档大多能被捞上来。GPT-5.5 配 BM25 的 gold 召回已经到 94.4%。真正卡住的是冷启动。agent 从空历史出发,容易把整道题压成一条过载查询,几条线索在同一条 query 里互相抢词。前几步只覆盖部分线索,后续轨迹就被不完整假设带跑,预算花在修路上。

方法

Question's Gambit 只接管第一次检索,后面的循环原样不动,也不重训 agent 或检索器。三步:

线索负责把覆盖面拉开,重排负责按「对整题有没有用」把含答案的文档按回来。扩展模型和重排器在三个 agent 上锁死,避免把增益算到更强模型头上。接到 Pi-Serini 之后,agent 继续 Preview、Read、Paginate、Retrieve,后续搜索仍是普通 BM25,墙钟预算 900 秒。

结果

主实验是 BrowseComp-Plus:830 题,语料 100,195 篇,平均每题 6.1 篇 evidence、2.9 篇 gold。

配置准确率校准误差gold 召回
Pi-Serini + DeepSeek-v4-pro71.4%7.092.5
Gambit76.9%3.9995.7
Pi-Serini + GPT-5.4-mini68.1%13.794.1
Gambit79.0%7.9094.6
Pi-Serini + GPT-5.583.1%15.794.4
Gambit90.5%7.5898.1

GPT-5.5 绝对提升 7.4 个百分点,p 值为 9.7×10⁻⁶;mini 提升最大,10.9 个百分点。表里其他体系只能当量级参照:gpt-5 配 Qwen3-Embedding-8B 是 73.0%,Tongyi-DR 配 AgentIR-4B 是 68.1%,agent 并不对齐。

轨迹比开局召回更能说明问题。GPT-5.5 的 gold 文档:surfaced 从 94.4 到 98.1,previewed 从 72.9 到 85.9,真正被打开或引用的 behavior 召回从 56.1 到 75.9。开局上下文不只是把文档捞上来,还让它们活过后续选择。

工具次数几乎没膨胀。BrowseComp-Plus 上总调用多 2.3 到 5.3 次,主要来自这一次 first-move 和多读几篇;GPT-5.5 的 search 从 13.5 次到 14.5 次。开局中位延迟 28.5 秒、大约 0.05 美元,整题中位 98 秒、大约 0.55 美元。

换到更常规的 MultiHop-RAG(200 题分层样本),GPT-5.4-mini 从 76.0% 到 77.0%,GPT-5.5 从 81.0% 到 81.5%。没掉点,也几乎没涨。

79 道 GPT-5.5 错题里,gold 从未被捞到的只有 3 道,占 3.8%;67.1% 是捞到了但没预览或没打开;29.1% 打开了 gold 仍答错。检索覆盖已经不是主瓶颈。

为什么重要

做深度研究系统,常见动作是在循环里加更强检索器、记忆模块、推理感知 retriever。这篇把「第一手」单独拆出来:不改循环、不重训,只换开局观察,GPT-5.5 就能从 83.1% 到 90.5%。

这套更适合「倒着猜实体」的多线索题。常规多跳几乎不动,它不是万能预处理。残差错误也把下一刀指清楚了:preview 排序、证据选用和综合,比再挖一遍语料更紧要。

实现已经公开。落地成本主要是一次拆解、大约 10 次并行扩展、以及一次 Cohere 重排;相对 agent 循环本身不算贵。

局限与存疑

作者自己写了几条:只测了固定语料,没测开放网页;BrowseComp-Plus 上三个模型、MultiHop-RAG 上两个;候选生成只有 BM25,dense 和 hybrid 会怎样不知道;也没把「开局文档带偏」这件事测透。

另外几处论文没补。没有拆掉扩展或重排的消融,9.6 条线索、k=5、Cohere Rerank4 Pro 各自贡献多少说不清。MultiHop-RAG 的 0.5 到 1 个百分点更接近「换题型不伤」,撑不起「稳健迁移」这么重的表述。开局给的仍是标题加大约 300 字 excerpt,agent 还必须调用 readdocument。这是把第一份候选名单换好,阅读一步没有省掉。

术语

原文与代码

社区讨论

相关论文

全部论文解读