Qdrant 实测:EmbeddingGemma 2 向量内存压缩 77 倍仅损 5% 质量

qdrant_engine · x · 2026-10-07

Qdrant 团队拿到 Google EmbeddingGemma 2 早期访问权限,实测向量压缩极限:1000 万条向量从 float32 768 维的约 30GB 内存,经 1-bit TurboQuant 量化压到约 1GB(保留 99% nDCG@10),再叠加 MRL 降到 256 维后仅需约 0.4GB,配合 rescoring 保留 94.5% 检索质量。总内存节省约 77 倍,质量损失约 5%,该成果还被 Google 官方公告引用。

所属事件:Qdrant 实测 EmbeddingGemma 2:内存压缩 77 倍(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →