Perplexity 发布 pplx-embed-v2-late:免 OCR 晚期交互嵌入模型霸榜
perplexity_ai · x · 2026-10-08
Perplexity 官方发布 pplx-embed-v2-late 系列:两个晚期交互(late-interaction)嵌入模型,可在统一嵌入空间中同时检索文本、图像和整页内容,已开源至 Hugging Face。
技术要点
- 传统稠密嵌入把整篇文档压成一个向量,页面越长越视觉化细节损失越多;该模型为每个 token 保留 128 维向量,用 MaxSim 打分,查询 token 与文档中最匹配 token 对齐。
- 直接嵌入图像和渲染后的页面,PDF、幻灯片、扫描件无需 OCR 即可检索,保留文本抽取会丢掉的表格、图表和版式。
成绩
- MADQA(800 份 PDF、500 个问题)上达 92.4%,为检索器最高分。
- Q2D-Web(约 7 万条生产查询、1.9 亿网页)上,9B 和 0.6B 模型 Recall@1000 分别为 74.8% 和 73.6%,高于 nemotron-embed-8b 的 69.3%。
- 智能体搜索中,GPT-OSS-120B 配 9B 模型在 BrowseComp+ 上答对 64.0%,领先次优 ColBERT 4.9 分,且检索次数少于所有基线。
- 两档尺寸由同一 18B 教师逐 token 蒸馏而来,共享嵌入空间:用 9B 索引的语料可用 0.6B 查询,ViDoRe v3 从 62.3% 升到 63.5% 且查询成本不增。
所属事件:Perplexity 开源 pplx-embed-v2 嵌入模型,多模态免 OCR 检索登顶(13 条相关)→
「模型」频道最新
- SentenceTransformers 原生支持 ColPali 视觉检索模型 — tomaarsen · 2026-10-08
- Plus 用户吐槽:ChatGPT 思考时间翻倍,答案质量却没变好 — Gazialp · 2026-10-08
- Mistral Large 4 登 Code Arena 第 45 名,价格仅 Opus 4.8 的 1/6 — arena · 2026-10-08
- Liquid AI 开源 d1 决策模型家族,3B 与 600M 两款多模态模型 — JosephJacks_ · 2026-10-08
- d1-omni-600M 细节:600M 参数支持文本+图像或音频输入 — JosephJacks_ · 2026-10-08
- Anthropic 员工:Opus 3 并不遵循自家宪法,但它看见了那份诚意 — repligate · 2026-10-08