多向量视觉文档索引可被反演:恢复 47% 词汇,98.4% 检索回源页
Zhuchenyang Liu · hf · 2026-10-08
一项安全研究揭示,主流多向量视觉文档检索器把每页存成约千个 patch 向量(常托管在第三方向量库),因「向量读不出页面」常被当作低于原文的敏感度对待——但事实并非如此。
攻击与发现:
- 由于索引按 raster 顺序为每个 patch 存一个向量,且向量由预训练读文档的 VLM 计算,作者将反演建模为条件文档图像生成,推断攻击所需信息:编码器、页面形状,以及乱序向量的顺序;
- ViDoRe v3 上,从原始索引反演的页面可恢复 47% 的词和 45% 的敏感 token;作为查询检索时 98.4% 的页面排名第一;
- 廉价防护:token 池化与乱序都能把词召回降到约 8%,但一个恢复乱序顺序的模型可将源页第一的占比从 3.8% 拉回 93.5%,池化索引的反演仍是开放问题;
- 攻击可直接迁移到另一多向量检索器,反演页面仍有 70.2% 排名第一。
结论:多向量视觉文档索引应像其编码的文档一样受到保护。
所属事件:研究揭示多向量视觉文档索引可被反演还原近半页面文本(2 条相关)→
「安全」频道最新
- ColPali 式文档索引可被反演还原页面,近半文本可读出 — _reachsumit · 2026-10-08
- AI 解开数学难题后,公钥加密的数学根基引发担忧 — sebkrier · 2026-10-08
- 前 OpenAI 政策负责人吐槽:AI 政策研究追不上事件爆发速度 — Miles_Brundage · 2026-10-08
- OpenAI 一次性解雇三名核心安全员工,WSJ 报道引行业震动 — NathanpmYoung · 2026-10-08
- 密码学家 Matthew Green:大厂实验室正雇密码分析员,成果披露须谨慎 — matthew_d_green · 2026-10-08
- NVIDIA 论文:多模态模型接入工具后拒答有害请求能力大幅下降 — JeremyCMorgan · 2026-10-08