Perplexity 开源 pplx-embed-v2-late 双模型,免 OCR 图文检索

Perplexity 于 10 月 8 日发布并开源 pplx-embed-v2-late:一个 9B 与一个 0.6B 的晚期交互多向量嵌入模型,基于 Qwen3.5 双向注意力,逐 token 保留 128 维向量,检索采用 MaxSim 晚交互机制。两模型可统一检索文本、图像与整页内容,PDF、幻灯片、截图、图表等文档页面可直接当作图像检索,无需 OCR,已上线 Hugging Face(据 @antoinechaffin 为 MIT 协议),并原生支持 Sentence Transformers(需 sentence-transformers>=6.0.0),pip 安装即可使用。

已确认

为什么重要

共享嵌入空间的非对称检索范式让低成本设备端查询与大模型离线索引结合成为可能;免 OCR 的页面级视觉检索显著降低文档处理管线复杂度,且检索质量提升可传导至下游 agent 答案准确率。

2026-10-08 ~ 2026-10-08 · 36 条相关

一手来源

另有 4 条近重复转述:beirmug · CShorten30 · antoine_chaffin · antoine_chaffin