Perplexity 发布 Q2D-Web:1.9 亿文档+7 万 agent 查询的 RAG 检索基准
_reachsumit · x · 2026-09-09
Perplexity AI 推出 Q2D-Web,面向 agentic RAG 第一阶段检索的评估基准:
- 语料库约 1.9 亿网页文档,配套约 7 万条由真实用户查询经 agent 改写而来的搜索请求,覆盖十种语言。
- 现有公开基准的缺口:大规模语料库评测查询太少,查询多的基准语料又只有百万级;且多数基准用人工查询,而生产系统中第一階段检索器面对的是分布不同的机器改写查询。
- 提供三套相关性标注:agent 引用、生产排序,以及二者合并并加入 LLM 判断以降低假阴性的组合集。
- 对 13 个检索器(词法、稠密、late-interaction)做基准测试,发现其相对排序对标注集选择基本不敏感。
「研究」频道最新
- 往机器人 VLA 模型里加希腊语:双语训练可提升性能但远逊英语 — KIEFERSA · 2026-09-09
- Transformer 早编码晚启用:对对话者专业水平的推断各层何时生效 — Mika Okamoto · 2026-09-09
- Cadence:用时序基础模型实现误差有界的有损时间序列压缩 — Roberto Tacconelli · 2026-09-09
- ECCV 2026 第四届 Perception Test 挑战赛聚焦城市级空间智能 — AjdDavison · 2026-09-09
- Meta 研究员分享 capi 训练技巧:按批次比例丢弃样本保住 GPU 效率 — TimDarcet · 2026-09-09
- Common Crawl 发布实验性图嵌入数据集,覆盖 5290 万网站主机 — lhoestq · 2026-09-09