Perplexity 发布 Q2D-Web:面向 Agentic RAG 的检索评测基准与公开排行榜
perplexity_ai · x · 2026-09-10
Perplexity 推出 Q2D-Web(Query2Doc-Web),一个用于评测 agentic RAG 系统中嵌入模型检索能力的大规模基准与公开排行榜。
- 数据基础:九个月内收集的 23,000 条去除 PII 的生产环境搜索查询,覆盖十种语言(英语占 65.8%)和编程、法律、健康、科学、金融、旅游等数十个领域。
- Agent 改写:将用户请求重构为主查询与辅助查询,每条独立评估、独立打相关性判断。
- 规模:合并集包含 1.9 亿网页文档、69,721 条 agent 改写查询,平均每条查询有 99.6 个正面相关性判断,用于降低假阴性。
- 三套相关性集:agent 引用、生产环境网页排序、LLM 扩展判断,减少对单一标注管线的依赖。
- 评测结果:13 个检索模型、以 Recall@1000 为主指标,pplx-embed-v1-4b 在 Web Ranking(65.73)和 Combined(69.11)领先,NVIDIA Nemotron-3-Embed-8B 在 Citation(61.68)领先。
- 提出基于 RRF 的子采样方法,仅用 31.7% 文档即可保持全量排名,将 pplx-embed-v1-4b 的评测成本从 4,608 H200 GPU 小时降到约 1,500。
所属事件:Perplexity 开源 Q2D-Web 智能体检索基准(6 条相关)→
「Infra」频道最新
- Epoch 数据:头部 AI 公司算力年增 4 倍,OpenAI 两年涨近 20 倍 — Jsevillamol · 2026-09-10
- 128GB Strix Halo 跑 Qwen3.8 Flash:Q4+Q8 n-gram 混合量化的内存账与困惑度实测 — MarkoMarjamaa · 2026-09-10
- 新用户携项目入驻时,Agent 自动生成最优 Dockerfile 优化启动时间 — lucasmeijer · 2026-09-10
- MEM Orchestrator:8GB GPU 上 LLM 训练的自适应内存控制平面,公开求破解 — uBazzyZ- · 2026-09-10
- OpenAI 算力两年暴增近 20 倍,头部公司年增 4 倍 — The Verge AI · 2026-09-10
- Keras 推出 ZeroModels:100+ 模型族纯 Keras 3 跨后端运行 — fchollet · 2026-09-10