Qdrant 实测:EmbeddingGemma 2 向量内存压缩 77 倍仅损 5% 质量
qdrant_engine · x · 2026-10-07
Qdrant 团队拿到 Google EmbeddingGemma 2 早期访问权限,实测向量压缩极限:1000 万条向量从 float32 768 维的约 30GB 内存,经 1-bit TurboQuant 量化压到约 1GB(保留 99% nDCG@10),再叠加 MRL 降到 256 维后仅需约 0.4GB,配合 rescoring 保留 94.5% 检索质量。总内存节省约 77 倍,质量损失约 5%,该成果还被 Google 官方公告引用。
所属事件:Qdrant 实测 EmbeddingGemma 2:内存压缩 77 倍(2 条相关)→
「Infra」频道最新
- 博主预言成真:OpenAI 推 500 美元档,企业疯狂控 token 成本 — labeveryday · 2026-10-07
- vLLM XPU 支持上线,Intel Arc Pro B70 本地跑 LLM 有了新引擎 — vllm_project · 2026-10-07
- 晒出自制微型集群:M5 Max 128GB+Linux RTX 6000 跑本地 AI — pcuenq · 2026-10-07
- RTX 6000+M5 笔记本异构跑 MiMo 2.6 Flash,40 tokens/sec — pcuenq · 2026-10-07
- RTX 6000+M5 笔记本异构跑 MiMo 2.6 Flash,40 tokens/sec — pcuenq · 2026-10-07
- 预算 1800 美元跑本地大模型:5060Ti 用户求 GPU 升级方案 — espece-de-bon · 2026-10-07