vec2vec 实现任意嵌入空间互译,向量库窃取可还原敏感信息
康奈尔团队发布论文《Reading Between the Lines: Translating Text Embeddings Across Model Borders》,提出 vec2vec 方法,可在任意两个文本嵌入空间之间学习翻译,无需配对句子、原始编码器或词典,仅依靠对抗训练、重建、循环一致性与距离保持损失,利用嵌入的普适几何结构完成映射。这一结果表明不同模型的嵌入空间存在可利用的共性结构,也带来向量数据库安全隐患。
已确认
- 在最难的跨骨干网络配对上,vec2vec 达到最高 0.96 的余弦相似度、100% 的 top-1 准确率与平均排名 1。
- 在分布外数据(推文与临床笔记)上仍保持超过 0.73 的余弦相似度,远超随机猜测,说明方法在真实场景有效。
- 安全含义:被盗向量数据库可被武器化——用 vec2vec 将嵌入翻译到已知空间后,无需原文即可还原敏感信息,准确率达 80%。
- 有作者将 vec2vec 与康奈尔另一篇论文《Harnessing the Universal Geometry of Embeddings》(NeurIPS 2025)及博客长文结合解读,指出几何结构是该方法的根基。
为什么重要
- vec2vec 打破了「嵌入不可逆、跨模型不可比」的常见假设,意味着仅持有向量(而非原文)也可能泄露隐私。
- 对企业向量数据库与 RAG 系统的安全设计提出直接警示:向量本身的访问控制同样关键。
2026-09-10 ~ 2026-09-10 · 5 条相关
一手来源
- vec2vec 无配对数据实现任意文本嵌入空间互译 — maier_ak ·
- vec2vec 论文:跨模型边界的文本嵌入翻译方法 — maier_ak ·
- 【源头】vec2vec 论文:跨模型边界的文本嵌入翻译方法 — maier_ak · 2026-09-10
- 【源头】vec2vec 无配对数据实现任意文本嵌入空间互译 — maier_ak · 2026-09-10
- vec2vec 跨骨干网络翻译:top-1 准确率 100%,余弦相似度达 0.96 — maier_ak · 2026-09-10
- vec2vec 研究显示被盗向量库可还原敏感信息,准确率达 80% — maier_ak · 2026-09-10
- 被窃的向量库可武器化:嵌入跨模型翻译泄露敏感信息 — maier_ak · 2026-09-10