向量搜索拆成四步:从编码到点积排序的完整原理
techNmak · x · 2026-10-02
一条系统的向量搜索科普线程,把整个流程拆为 encode、normalize、compare、rank 四步:
- 编码:文档经嵌入模型(如 all-MiniLM-L6-v2)生成 384 维向量,token 表示做 mean pooling(排除 padding)后存下向量与原文段落 ID;
- 归一化:查询与文档都做 L2 归一化,落进同一嵌入空间;
- 比较:归一化后余弦相似度退化为点积 cos(q,v)=q·v;
- 排序:对候选打分、排序、取 top-k。
作者算了笔账:100 万条 384 维向量做一次精确扫描需要约 3.84 亿次坐标乘法,成本随存储量线性增长,因此大规模场景改用 HNSW、IVF 等近似最近邻索引,用可能漏掉部分精确 top-k 换速度。最后点出关键局限:向量相似只衡量嵌入空间里的距离,并不能证明检索内容正确、完整或足够相关。
「研究」频道最新
- OpenAI 安全研究 VP 翁荔公开博客写作七步法 — SinclairWang1 · 2026-10-02
- Arena.ai 发布 HarnessTax:编码 Agent 的 harness 到底影响多大 — solyarisoftware · 2026-10-02
- 伯克利论文:LLM 记得你的新指令却仍用旧选择 — rohanpaul_ai · 2026-10-02
- 模型权重不动,Harness 自进化:Terminal-Bench 成绩 47.57 升至 52.43 — jiqizhixin · 2026-10-02
- 3 万对艺术二维码错觉数据集开源:多解码器验证+鲁棒性评分 — 1roOt · 2026-10-02
- 澄清:Google Diffusion Controller 的 90% 胜率与灰盒设定是两回事 — Crescitaly · 2026-10-02