Perplexity 公开自研嵌入推理三层架构
9 月 5 日,Perplexity 官方账号发布系列推文与研究文章,公开其搜索答案链路底层——支撑 pplx-embed 系列嵌入与 reranker 模型、EB 级搜索索引——的 SoTA 自研推理服务基础设施,称在线与批量两类工作负载均实现更低延迟与更高吞吐,较现成方案带来更快搜索与更低成本;转发该博客的 @inductionheads 转述称,其 embedding 服务比 vLLM 快 3-4.8 倍。
已确认
- 检索基础:查询与文档嵌入到同一向量空间后按最近邻搜索,由此产生两类工作负载——面向吞吐的批量嵌入(用于索引与打分)和面向延迟的单查询在线嵌入(用于实时搜索),需分别优化。
- 三层架构:Ivy(Rust HTTP 网关)负责 CPU 侧请求准备——解析、分词、模板化,并经 gRPC 发往 Tulip 前拆分大批量请求,可独立调优请求格式与分词逻辑而不动推理服务器;Tulip(Rust gRPC 推理服务器)位于 Ivy 与 ROSE 之间,收集请求、组批后送 GPU,并利用 CUDA graphs 与 LazyTensors 压延迟提吞吐;ROSE(Python 引擎)使 LLM 与嵌入模型复用同一套 kernel,嵌入推理时跳过 KV cache,以 ragged attention 替代 paged attention,支持多个注意力后端。
- 性能特征:对小型嵌入模型,运行时间取决于 token 数而非查询数,约 512 token 即可填满 GPU。
为什么重要
- Perplexity 将搜索引擎核心的嵌入检索链路从现成推理方案迁移到自研栈,公开了完整的分层设计与优化细节,为大模型检索系统的工程实践提供了少见的参考样本。
2026-09-05 ~ 2026-09-05 · 8 条相关
一手来源
- Perplexity 公开自研 SoTA 嵌入与排序模型推理服务架构 — perplexity_ai ·
- Perplexity 称自研推理栈比现成方案更快更省,在线批量双优化 — perplexity_ai ·
- Perplexity 开源级揭秘:embedding 服务比 vLLM 快 3-4.8 倍 — inductionheads ·
- 【源头】Perplexity 公开自研 SoTA 嵌入与排序模型推理服务架构 — perplexity_ai · 2026-09-05
- Perplexity 详解嵌入检索原理:批量与在线两类工作负载如何分流 — perplexity_ai · 2026-09-05
- 一图看懂 Perplexity 推理三层架构:Ivy、Tulip、ROSE 各司其职 — perplexity_ai · 2026-09-05
- Perplexity 批调度层 Tulip:CUDA graphs 加 LazyTensors 压延迟提吞吐 — perplexity_ai · 2026-09-05
- Perplexity 自研引擎 ROSE:嵌入推理跳过 KV cache 改用 ragged attention — perplexity_ai · 2026-09-05
- Perplexity 推理栈解析:Ivy 网关承担 CPU 侧预处理与批量拆分 — perplexity_ai · 2026-09-05
- 【源头】Perplexity 称自研推理栈比现成方案更快更省,在线批量双优化 — perplexity_ai · 2026-09-05
- 【源头】Perplexity 开源级揭秘:embedding 服务比 vLLM 快 3-4.8 倍 — inductionheads · 2026-09-05