DeepSearchQA: Bridging the Comprehensiveness Gap for Deep Research Agents
Nikita Gupta, Riju Chatterjee, Lukas Haas, Connie Tao, Andrew Wang, Chang Liu, Hidekazu Oiwa, Elena Gribovskaya, Jan Ackermann, John Blitzer, Sasha Goldshtein, Dipanjan Das
www
cs.CL
2026-01-29
Google用900道穷尽检索题测Deep Research:Gemini全对66.09%、F1 81.90,Flash全错率45.27%,最后一公里差约15分。
SimpleQA、BrowseComp、GAIA、Humanity's Last Exam 几乎都按「找出那一个正确答案」来出题。这种格式好打分:对就是 1,错就是 0。它也把搜索 agent 推向找针路线,精度优先,找到就停。
真实调研经常要交一份名单。用户要的是满足一串约束的完整集合:2019 到 2020 年,美国哪几个州因当年头号死因导致的死亡率落在某个区间;或者按房价、绿地、就业、清洁空气区四道过滤,筛出能搬家的英国城市。信息散在 CDC 表、统计局、公司年报里,没有任何单页写着完整答案。论文把现有评测测不到的这块叫做 Comprehensiveness Gap,完备性缺口。
DeepSearchQA 共 900 道专家手写题,覆盖 17 个领域,公共治理、金融、科学、健康、历史、地理、媒体都在里面。每道题做成因果链:后一步必须吃上一步筛出来的集合,专门压长程规划和上下文保持。题面锚定时间或静态数据源,比如「按 2020 年人口普查」,减轻 live web 上金标漂移。
答案分两类。Single Answer 仍是唯一实体,但信息偏门,网上证据还会打架。Set Answer 是枚举或复合子问题,必须交完整集合。质检走三阶段:三位审阅者先不看金标各自检索,再对照出题人的答案,冲突进入裁决;含糊题直接丢掉。
任务按认知负担分成三档:
评测只看最终提交的集合,不看点了哪些链接。主指标是集合 Precision、Recall 和 F1。另外切四类:Fully Correct 要求集合语义完全相等;Fully Incorrect 一个都没对上;Partially Correct 对了一部分;Correct with Extraneous 是金标全找到了又多塞错项,对应 hedging(两头押注,把相邻实体也写进去)。语义是否算同一项,由 Gemini 2.5 Flash 零样本判定。Kaggle 独立打分并维护公开榜。
设计上压三件事:从分散来源系统汇集、表面形式不同的实体去重、在开放搜索空间里判断何时该停。停的难点是分清「还没找到」和「根本不存在」。
Kaggle 独立评测主表如下(Fully Correct / Fully Incorrect / 多塞错项 / F1):
| 模型 | Fully Correct | Fully Incorrect | 多塞错项 | F1 |
| Gemini Deep Research Agent | 66.09 | 9.95 | 10.30 | 81.90 |
| GPT-5 Pro High Reasoning | 65.18 | 14.13 | 8.12 | 78.98 |
| GPT-5 High Reasoning | 59.41 | 19.91 | 6.56 | 73.24 |
| Gemini 3 Pro Preview | 56.56 | 12.78 | 9.89 | 76.86 |
| o3 Deep Research | 44.24 | 20.09 | 11.74 | 66.45 |
| o4 Mini Deep Research | 40.36 | 24.19 | 7.80 | 61.76 |
| Gemini 2.5 Flash | 25.92 | 45.27 | 5.90 | 42.99 |
| Claude 4.5 Opus | 24.01 | 50.66 | 4.18 | 40.20 |
| Claude 4.5 Sonnet | 16.04 | 64.25 | 2.90 | 27.85 |
| Claude 4.5 Haiku | 12.78 | 71.00 | 1.89 | 22.24 |
Gemini Deep Research 和 GPT-5 Pro 的全对率在 95% 置信区间内打平,但 Gemini 全错率更低:9.95% 对 14.13%。论文据此认为 Gemini 更少整条轨迹跑飞。Claude 4.5 在表里是独立推理模型,没有对等的 Deep Research 浏览循环,分差不能直接读成「Claude 不会检索」。
测试时把 Gemini Deep Research 采样从 n=1 加到 n=8,全对率从 67.18% 升到 85.71%;n=2 为 74.51%,n=4 为 81.72%。便宜模型这边是台阶:Gemini 2.5 Flash 的 F1 掉到 42.99,全错率 45.27%,大约是头名的五倍。把研究任务降配到 Flash 或 Haiku,不是少几个百分点,是检索路径整段作废。
F1 81.90 和 Fully Correct 66.09 大约差 15 分,论文称为 Last Mile Problem。GPT-5 Pro 这边大约差 13 分。一边是召回不够、漏掉长尾实体;一边是召回拉满却停不下来,往相邻话题里塞额外项。
失败案例三类。Gemini 在 Eurostat 货运题上找齐了候选国家,却用估算吨位排名,排错了。GPT-5 Pro 碰到美国机场准点率的 Excel 下载,声称聊天里打不开就停;Gemini 换源还能部分做对。GPT-5 Pro 列出牛津 Sherardian 图书馆的植物学家名单后,没按「从未担任该讲座教授」过滤。
如果产品经理只拿 BrowseComp 或 HLE 这种单答案榜做验收,会系统性低估「列全」有多难。DeepSearchQA 把撒网探索和核验停搜做成可打分的集合匹配。F1 高、Fully Correct 低,说明「差不多找齐了」和「交得出干净名单」不是一回事。
测试时多采样能把全对率从约 67% 抬到约 86%,算力换完备性在这套题上成立。反过来,研究任务降配到便宜模型,全错率直接翻到一半上下。
对要交完整名单的产品,该盯 Fully Correct 和多塞错项率,不要只看 F1。停搜策略、工具能否打开表格、实体消歧,眼下比再堆一次搜索步数更值钱。
论文自己承认两点。只评最终集合,分不清是推理对了还是蒙对了;网页会改、会下线,静态金标会腐,需要定期人工回扫。
还有几处没处理干净。Judge 是 Gemini 2.5 Flash,榜上又有多家 Gemini 系统,交叉偏差没有独立裁判对照。Claude 缺对等 agent 脚手架,表上的断层不能当模型能力排名。成本优势只指向公开定价页,没有给出本基准上的实际美元。主表全对 66.09% 和采样实验 n=1 的 67.18% 对不齐,文中没解释是不是同一轮评测。