Weaviate 1.39 四位旋转量化:千万 OpenAI 向量从 61GB 压到 7.8GB
philipvollet · x · 2026-09-08
Weaviate 1.39 的 4-bit Rotational Quantization 将 1000 万条 OpenAI 向量的内存占用从 61GB(float32)降到 7.8GB。1536 维下每向量从 6144 字节缩到 784 字节——16 字节头 + 768 字节编码,压缩比是 7.84x 而非整数 8x(头部恒定),作者称赞发布说明没有向上取整。
两步流程与 8-bit RQ 相同:
- 用 Walsh-Hadamard 变换做快速伪随机旋转,均匀分散信息并把维度补齐到 64 的倍数(1536=24×64,零成本)
- 逐向量按自身 min/max 推导区间做 4-bit 标量量化,每字节存两维
新意在非对称设计:存储用 4-bit,查询时量化到 8-bit,零存储成本却买回了大部分精度损失。
「Infra」频道最新
- SemiAnalysis:TPU v7 每美元推理性能比 Blackwell Ultra 高 50% — Sentdex · 2026-09-08
- Intel 推进 High NA EUV 量产节奏,台积电三星确认本十年末导入 — BenBajarin · 2026-09-08
- 192GB 内存的 Mac 跑 GLM:用户求助定制 Q3/Q4 GGUF 量化 — CentrifugalMalaise · 2026-09-08
- 社区自制 GPU 选购指南:按每美元显存和带宽横向对比 — jacek2023 · 2026-09-08
- 传台积电年投百万片 High-NA EUV 晶圆,业内称有可能 — pstAsiatech · 2026-09-08
- 400MB 的 Qwen3-0.6B 在 2017 年旧手机上驱动真实桌面 Chrome 完成网页任务 — Mean-Standard7390 · 2026-09-08