一次 int8 运算让 late-interaction 检索的精确重打分几乎零成本
antoine_chaffin · x · 2026-09-03
作者在 next-plaid 1.7.0 中用一次 int8 运算,把 PLAID 风格 late-interaction 检索中最慢的一环——精确重打分(exact rescoring)——优化到几乎零开销:
- 性能对比显示 1.7.0 相比 1.6.5,「decompress」阶段直接消失;
- 兼容已有索引,纯 CPU 运行,无需重建;
- 细节见作者推文线程。
「Infra」频道最新
- 开源 ArtSmoker:一条提示词直出带贴图可入引擎的 3D 模型 — niravdd · 2026-09-03
- 长上下文本地推理的真正瓶颈是 KV cache 而非参数量 — jonejy · 2026-09-03
- AMD 显卡跑 ComfyUI:RX 6800 XT 与 9060 XT 差价 105 美元怎么选 — Nice-Regret-9207 · 2026-09-03
- 开发者提醒:Cloudflare 新增功能疑似损害 SEO,建议关闭 — gaganghotra_ · 2026-09-03
- Hot Chips 名单未见 Amazon Trainium,投资人质疑其真实竞争力 — firstadopter · 2026-09-03
- Dragonfly 重写 Redis:分片多线程架构吃满现代服务器算力 — techNmak · 2026-09-03