为什么多模态检索要直接嵌入渲染页面?late interaction 作者详解设计动机
antoine_chaffin · x · 2026-10-08
antoinechaffin 在推文中解释其检索模型两项核心设计的原因:
为什么多模态:真实世界语料不是干净文本,而是 PDF、幻灯片、扫描件、图表和表格;用解析加 OCR 的方式成本高且有损——版式、表格、图形信息都会丢失。因此模型直接嵌入渲染后的页面,文本查询即可搜索页面本身,对自然图像同样有效。
为什么改用 late interaction:稠密模型把整个文档压缩成单一向量,文档越长越多样、信息越密(图像尤甚),单向量挤不下;且单次点积表达力有限。改为每 token 一个向量加 MaxSim,可同时解除这两个瓶颈。
所属事件:Perplexity 开源多模态嵌入模型 pplx-embed-v2-late(38 条相关)→
「研究」频道最新
- iOSWorld 亮相 COLM 2026:专注 iOS 环境的计算机使用 Agent 基准 — kohjingyu · 2026-10-08
- Epoch发布InnovationEval:AI做出重大创新的能力仍远不达标 — Afinetheorem · 2026-10-08
- Dankrad:数学本不优雅,是人类的小上下文窗口造成了错觉 — CatAstro_Piyush · 2026-10-08
- 礼来与诺和诺德公布大规模试验数据:GLP-1 药物可降低生物年龄 — MaxUnfried · 2026-10-08
- 三周冒出 113 个决策模型:七成基于 Qwen,最便宜的不到一厘钱 — jonathanmalkin · 2026-10-08
- 56 亿条 TikTok 视频元数据上架 Hugging Face,附可查询数据库 — DataShack · 2026-10-08