Qdrant 发布百亿级向量检索数据集,含 10 万查询精确答案
qdrant_engine · x · 2026-09-08
Qdrant 团队在 Hugging Face 发布了一个 100.7 亿向量的检索基准数据集,为 10 万条查询提供精确 top-1000 真值结果,并开源了名为 Supernova 的基准测试引擎,用于互联网规模向量数据集的评测。
作者指出现有向量检索基准的三大结构性缺陷:
- 规模上限通常只到 1000 万至 1 亿条向量
- 缺少真实的 ground truth 检索结果
- 普遍忽略稀疏与多向量表示,覆盖不到生产环境中常见的混合检索与过滤模式
该基准旨在推动社区从百万级的'微优化'走向面向数十亿向量的架构设计。文中还列举了 HF 上现有的主流预嵌入数据集(如 Cohere Wikipedia 多语言 2.5 亿向量、BGE-M3 1.44 亿向量等)作为参照。
「Infra」频道最新
- 日本推出 JapanFold:8 个开源生物学 AI 模型免费供国内研究者使用 — DavidBennett__ · 2026-09-08
- M4 MacBook Air 已吃力:开发者用 Codex 跑本地 MLX 模型生成音乐 — Dimillian · 2026-09-08
- 驳「数据中心次声伤人」论:逐条拆解爆火视频的误导引用 — AndyMasley · 2026-09-08
- 电网跟不上:AI 集群建设者转向燃气轮机与 SMR 自发电 — AccBalanced · 2026-09-08
- 黄仁勋称 GPU 是可出租生息资产,H100 租价月涨 22% — AccBalanced · 2026-09-08
- 拆解移动端 AI Agent 的底层:VM 如何支撑 Instinct 与 Claude Code — RohanAdwankar · 2026-09-08