Embeddings 技术手册:从第一性原理讲透向量检索与 RAG 踩坑
techNmak · x · 2026-09-17
作者指出「embedding」一词在现代 AI 里承担了太多不同含义,并系统梳理了它们之间的区别与生产环境的坑。
核心内容
- 三种 embedding 不一样:token embedding 是词表矩阵里学出来的一行;contextual embedding 是依赖上下文的隐藏状态向量;句/文档 embedding 还需额外的 pooling 或 readout 把变长表示压成固定向量。三者相关但不可互换。
- 几何是学出来的:向量本身没有天然语义,维度 768 或 1024 并不保证语义空间;是对比训练、hard negatives、pooling 策略、归一化和相似度函数共同塑造了这个空间。
- 生产级踩坑:余弦相似度与点积一般不等价(仅单位归一化时一致);同维度换 embedding 模型并不会保留坐标系;忽略查询/文档前缀会改变非对称训练模型的结果;改预处理或 pooling 即使向量形状不变也会让已有索引失效。
- 作者据此写了一份从第一性原理讲起的技术手册,覆盖 token 查找表、上下文表示、pooling、cosine/dot/L2 几何、对比学习、稠密检索、Matryoshka 表示、多语言与多模态 embedding,以及用于搜索和 RAG 时的实现细节。
核心心智模型:embedding 是为特定目的学到的有用几何,理解它要知道映射了什么、向量怎么产生、什么目标塑造了空间、向量如何比较。
所属事件:Embeddings技术手册:从第一性原理讲透向量检索(2 条相关)→
「编程与Agent」频道最新
- QOJ 榜单:GPT-6 Pro 在多道竞赛题上找到远超出题人的解法 — teortaxesTex · 2026-09-17
- GitHub MCP 维护者登台 MCPCon,力辩「MCP 没有上下文问题」 — marlene_zw · 2026-09-17
- 数据分级即路由:Agent 时代按标签决定数据能喂哪个模型 — blaizedsouza · 2026-09-17
- Agent 蜂群成第三条 scaling 轴:万级集群实测已跑通 — Upset-Winter7174 · 2026-09-17
- 当 RAG 检索到投毒文档,Agent 会照做吗?团队将其做成可复用安全测试 — Tophant_ · 2026-09-17
- Agent 替员工「翻译」需求而非填表单:广播媒体客户的自动化实践与两难 — NumbersProtocol · 2026-09-17