Q2D-Web: A Large-Scale Benchmark for Retrieval in Agentic RAG Systems
Maximilian Schall, Sedigheh Eslami, Markus Krimmel, Antoine Chaffin, Louis Milliken, Bo Wang, Denis Bykov
cs.IR, cs.CL
2026-09-08
Perplexity 用 9 个月生产流量建了 1.9 亿网页、6.97 万条 Agent 改写查询的私有检索榜。稠密模型 Recall@1000 最高 69.11,BM25 仅 44.77,却贡献了 1.46 万条独家相关文档,排名几乎不随标注集改变。
生产环境里的 agentic RAG,第一阶段检索器面对的是两件事:上亿网页的索引,以及 Agent 根据对话上下文改写出来的查询,不是用户亲手敲的那一句。现有公开榜对不上这个设定。
MS MARCO Web Search 有 1.009 亿文档,测试查询只有 9374 条,每条只标了一个点击文档。BrowseComp-Plus 把证据钉在固定语料上,但语料只有约 10 万篇、查询 830 条。TREC 网页轨每年大约 50 条人工标注查询。Penha 等人还测过:意图不变的改写,整条检索管线的 nDCG@10 平均掉约 20%。第一阶段漏掉的文档,后面 rerank 和引用都救不回来。
Q2D-Web 来自 Perplexity 九个月去标识化的生产流量。最终留下 69721 条 Agent 改写查询,覆盖十种语言:12365 条主查询(17.7%)贴近用户原意,57356 条辅助查询(82.3%)用来换说法、补背景、追相邻实体。语料是每条查询生产系统 top-5000 的并集,再按 token 5-gram Jaccard 至少 0.975 做 MinHash-LSH 去重,得到约 1.9 亿篇网页,篇均 13169 字符。这个池子本身就挤满了「看起来像、其实不对」的硬负例。
相关性给了三套可复用的二值标注,故意不绑死单一来源:
平均每条查询 99.6 个正例。用来做标注池和子语料抽样的神经检索器一律卡在 2025 年 1 月 1 日之前发布;评测的 13 个模型(BM25-tantivy、十个 0.3B 到 8B 的稠密编码器、两个 late-interaction)都在此日期之后,避免自己给自己出题。
全量扫一遍 pplx-embed-v1-4b 要 4608 张 H200 GPU 小时。他们比较了 depth-k pooling、RRF 和均匀随机三种抽样。RRF、k=1000 留下约 31.7% 语料,Kendall τb 为 1.00,平均 Recall@1000 只抬高 5.1 个点,4B 模型评测掉到大约 1500 GPU 小时。所有模型只编码文档前 512 token,而篇均大约 3.3k token。
主指标是 Recall@1000,因为第一阶段的任务是给后面 rerank 备候选;同时报 Recall@100 和 nDCG@10。
三套标注下,模型相对排序大体稳定,赢家随指标变。
| 模型 | Comb. R@1000 | Comb. nDCG@10 | 独家正例 |
| pplx-embed-v1-4b | 69.11 | 45.84 | 884 |
| Nemotron-3-Embed-8B | 68.58 | 47.44 | 705 |
| EmbeddingGemma-300M | 65.45 | 43.56 | 2451 |
| Qwen3-Embedding-8B | 64.53 | 42.69 | 596 |
| BM25-tantivy | 44.77 | 30.30 | 14621 |
Citation 上 Nemotron-3-Embed-8B 的 Recall@1000 最高,61.68;Web Ranking 和 Combined 上是 pplx-embed-v1-4b,分别 65.73 和 69.11。Nemotron-8B 在 Combined 的 Recall@100(30.03)和 nDCG@10(47.44)都更高,相关文档更靠前,总召回略少。Qwen3 家族从 0.6B 到 8B,Combined Recall@1000 从 57.89 单调升到 64.53。不到 1B 的稠密模型里,pplx-embed-v1-0.6b 最强,67.02。
所有神经模型在辅助查询上明显弱于主查询。BM25 反过来,辅助查询高约 1.9 个点,绝对水平仍垫底。它的 14621 条独家正例几乎是第二名 EmbeddingGemma 的六倍。late-interaction 在 Recall@1000 上落后同规模稠密模型 3 到 5 个点,nDCG@10 差距缩到最多 1 个点。
13 个系统都没排进 top-1000 的硬正例有 6424 篇:51.1% 是词面几乎不重叠,17.7% 是相关内容埋在长文后部,15.4% 是查询和文档跨语言。被全体判成负例却又全体排进 top-1000 的硬负例里,抽 4000 条复审,15.8% 其实相关;剩下的以错切面(39.0%)、部分相关(17.8%)、相近实体(13.8%)为主。
这是目前最接近「生产 Agent 第一阶段检索」的公开评测协议。语料和查询不公开,只开 Hugging Face 排行榜,目的就是防训练污染。做 embedding 的人可以按这个协议看:第一阶段看 Recall@1000,浅层看 nDCG@10,两者的冠军不是同一个模型。BM25 仍值得留在融合里,不是怀旧。辅助查询才是 Agent 检索真正的分布偏移。子语料抽样让社区有机会在单机 8×H200 上大约八小时内迭代,而不必每次烧 4600 GPU 小时。
Perplexity 自己的 pplx-embed 系列在自家流量上领先,读数字时要把这个放在桌上。
标注仍有假阴性:硬负例复审里 15.8% 被同一套 LLM 判官改口。Citation 天然低召回,Web Ranking 绑内部栈,Combined 绑 DeepSeek-V4-Flash 的口味。512 token 截断意味着多数正文没被任何系统看见;他们在子语料上把稠密模型加到 1024、late-interaction 加到 2048,名次没动,但没声称这是全文效果的无偏估计。没测 SPLADE 这类学习稀疏检索,理由是多语言 checkpoint 太少。独家正例最多的 BM25 该不该进融合,论文只提出问题,没有做对照实验。语料来自生产 top-5000 并集,不是随机网页,难度被有意抬高,也不能外推到整个开放网络。