ColPali 式文档索引可被反演还原页面,近半文本可读出
_reachsumit · x · 2026-10-08
一项新研究揭示:ColPali 风格的多向量视觉文档检索器把每页存成约一千个按光栅顺序排列的 patch 向量(常托管在第三方向量库),看似不可读,实则可被反演。研究者把反演建模为条件文档图像生成,攻击者可从索引推断编码器、页面形状乃至乱序向量的顺序。
关键结果:
- 在 ViDoRe v3 上,从原始索引反演的页面可恢复 47% 的词和 45% 的敏感 token;用作查询时 98.4% 的情况下其源页排名第一
- token 池化和向量乱序两种廉价防护都能把词召回率降到约 8%,但有模型可恢复乱序索引顺序,使源页排名第一的比例从 3.8% 回升到 93.5%
- 同样的攻击对另一多向量检索器仍使 70.2% 的反演页面排名第一
结论:多向量文档索引应被视为与页面本身同等敏感的数据,须加保护。
所属事件:研究揭示多向量视觉文档索引可被反演还原近半页面文本(2 条相关)→
「安全」频道最新
- MCP 安全讨论:生产环境如何在协议配置之上做会话级实时授权 — Longjupping_Tax_3598 · 2026-10-08
- 密码学家反驳:AI 数学进展威胁椭圆曲线安全毫无逻辑 — markjeffrey · 2026-10-08
- AI 安全之争其实没有分歧:真正的问题是保护谁、防什么、付多少代价 — Smart_Fly_5783 · 2026-10-08
- AI 解开数学难题后,公钥加密的数学根基引发担忧 — sebkrier · 2026-10-08
- 菲尔兹奖得主陶哲轩转发声明,呼吁数学家停止与 OpenAI 合作 — Eliv_nurotic · 2026-10-08
- 前 OpenAI 政策负责人吐槽:AI 政策研究追不上事件爆发速度 — Miles_Brundage · 2026-10-08