Perplexity 开源 Q2D-Web 智能体检索基准
Perplexity 于 9 月 9-10 日发布并开源 Q2D-Web(Query2Doc-Web),这是首个面向 agentic RAG 第一阶段检索的公开评测基准与排行榜,用于衡量嵌入模型在大规模网页检索中处理 agent 重新表述查询的能力,弥补现有公开基准在这一场景下的不足。
已确认
- 语料库约 1.9 亿网页文档,配套约 7 万条由真实用户查询经 agent 改写而来的搜索请求,覆盖十种语言。
- 数据基础包含九个月内收集的 23,000 条去除 PII 的生产环境查询。
- 评测指标采用 Recall@1000,而非常见的 nDCG@10,更贴合大规模网页检索场景。
- 方法细节上(据 @perplexityai 补充帖),基准结合 agent 引用、生产环境网页排名和 LLM 判定扩充三套相关性集合,以减少假阴性和对单一标注管线的依赖,并检验相关性定义本身如何影响模型表现。
- 基准与排行榜均公开可用。
为什么重要
随着 agent 大量改写用户查询再执行检索,传统基于人工短查询的检索基准已不能反映真实负载。Q2D-Web 以生产环境数据和 agent 改写查询为基础,为嵌入模型在 agentic RAG 中的表现提供了更贴近实际的评测标准,其多套相关性标注方案也对基准设计方法论本身有参考价值。
2026-09-09 ~ 2026-09-10 · 6 条相关
一手来源
- Perplexity 发布 Q2D-Web:面向 Agentic RAG 的检索评测基准与公开排行榜 — perplexity_ai ·
- Perplexity 发布 Q2D-Web:首个面向 agentic RAG 的检索评测基准 — perplexity_ai ·
- Q2D-Web 技术细节:三套相关性标注降低假阴性 — perplexity_ai ·
- Perplexity 发布 Q2D-Web:1.9 亿文档+7 万 agent 查询的 RAG 检索基准 — _reachsumit · 2026-09-09
- 【源头】Perplexity 发布 Q2D-Web:首个面向 agentic RAG 的检索评测基准 — perplexity_ai · 2026-09-10
- 【源头】Q2D-Web 技术细节:三套相关性标注降低假阴性 — perplexity_ai · 2026-09-10
- Perplexity 开源 Q2D-Web 基准:1.9 亿文档测智能体检索 — CShorten30 · 2026-09-10
另有 2 条近重复转述:perplexity_ai · antoine_chaffin