免推理 SPLADE 检索:查询延迟降到 BM25 水平的做法
qdrant_engine · x · 2026-09-22
KShivendu 在 Doug Turnbull 组织的 Retrieval Augmented Gathering 上分享 Inference Free SPLADE 模型。
- 传统 SPLADE 用 transformer 对文档做关键词扩展,让关键词搜索能匹配同义词和语义相近词,但每次查询都要跑模型,CPU 上 p50 延迟约 50ms,想更快还得用 GPU。
- 免推理方案把模型计算前移到文档侧离线完成,查询时开销与 BM25 相当。
- 议程涵盖原理、取舍(trade-off)以及如何上生产环境。
「Infra」频道最新
- 小米 MiMo-V2.6-Pro 开源模型 42B 激活参数逼近 GPT 5.6,单机 8 卡即可跑 — Jasonio · 2026-09-22
- AliExpress 现改版 RTX 3080 20GB 笔记本显卡,跑 ComfyUI 引热议 — thatguyjames_uk · 2026-09-22
- Whittle 蒸馏模型走红 Reddit,27B-A3B 声称可在 8GB 显存笔记本跑 — depressedclassical · 2026-09-22
- Qdrant 实测:百万级向量搜索延迟抖动是后台优化器在干活 — qdrant_engine · 2026-09-22
- Cloudflare 全家桶的真实短板:D1 单线程、10GB 上限 — Paimaamu · 2026-09-22
- Rackspace 加入 NVIDIA 云伙伴计划,押注受监管行业全栈 AI 运维 — DavidLinthicum · 2026-09-22