Perplexity 详解嵌入检索原理:批量与在线两类工作负载如何分流

perplexity_ai · x · 2026-09-05

Perplexity 官方推文解释其检索基础:查询与文档被嵌入到同一向量空间,按最近邻搜索。这产生两类工作负载——面向吞吐的批量嵌入(用于索引与打分)和面向延迟的单查询在线嵌入(用于实时搜索),对应基础设施需分别优化。

所属事件:Perplexity 公开自研嵌入推理三层架构(8 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →