一次 int8 运算让 late-interaction 检索的精确重打分几乎零成本
antoine_chaffin · x · 2026-09-03
作者在 next-plaid 1.7.0 中用一次 int8 运算,把 PLAID 风格 late-interaction 检索中最慢的一环——精确重打分(exact rescoring)——优化到几乎零开销:
- 性能对比显示 1.7.0 相比 1.6.5,「decompress」阶段直接消失;
- 兼容已有索引,纯 CPU 运行,无需重建;
- 细节见作者推文线程。
所属事件:next-plaid 1.7.0 用 int8 运算大幅提速后交互检索(2 条相关)→
「Infra」频道最新
- 把 NVIDIA DLSS 5 神经渲染器搬上 Mac:开源项目实测精度几乎无损 — WaveCut · 2026-09-05
- ESP32 语音助手实战:AIMET 量化把唤醒词模型压缩 8 倍 — carrycooldude · 2026-09-05
- 双 5070 Ti 跑 Qwen3.8-27B:三引擎实测,vLLM 一个 flag 差 11 倍 — puthre · 2026-09-05
- 开发者优化 GLM 5.2 在 B300 上的推理速度,并替换 Claude Code 中的 Anthropic 模型 — abhijithneil · 2026-09-05
- LLM 推理从 MVP 到生产:什么逼你换掉整套技术栈 — Ok_Philosophy_4031 · 2026-09-05
- 爆料称 GPT-6 Astra 元提示能力远胜 Claude Fable 5.1 — whoiskatrin · 2026-09-05