为什么多模态检索要直接嵌入渲染页面?late interaction 作者详解设计动机

antoine_chaffin · x · 2026-10-08

antoinechaffin 在推文中解释其检索模型两项核心设计的原因:

为什么多模态:真实世界语料不是干净文本,而是 PDF、幻灯片、扫描件、图表和表格;用解析加 OCR 的方式成本高且有损——版式、表格、图形信息都会丢失。因此模型直接嵌入渲染后的页面,文本查询即可搜索页面本身,对自然图像同样有效。

为什么改用 late interaction:稠密模型把整个文档压缩成单一向量,文档越长越多样、信息越密(图像尤甚),单向量挤不下;且单次点积表达力有限。改为每 token 一个向量加 MaxSim,可同时解除这两个瓶颈。

所属事件:Perplexity 开源多模态嵌入模型 pplx-embed-v2-late(38 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →