Perplexity 公开自研 SoTA 嵌入与排序模型推理服务架构
perplexity_ai · x · 2026-09-05
Perplexity 发布研究文章,介绍其搜索答案链路底层——嵌入与排序模型——的 SoTA 推理服务基础设施,覆盖在线与批量两类嵌入工作负载的延迟与吞吐优化。
官方账号发布的系列推文还拆解了架构细节:
- Ivy:Rust HTTP 网关,负责解析、分词、模板化等 CPU 侧预处理,经 gRPC 转发;
- Tulip:轻量 Rust gRPC 推理服务器,负责批处理调度,用 CUDA graphs 降低 CPU 启动开销、LazyTensors 异步流水线提高吞吐;
- ROSE:Python 模型引擎,LLM 与嵌入模型复用同一套 kernel,嵌入场景跳过 KV cache、用 ragged attention 替代 paged attention,支持多注意力后端按模型形状选择。
官方称组合方案相比现成方案在更快搜索的同时降低了成本。
所属事件:Perplexity 公开自研嵌入推理三层架构(8 条相关)→
「Infra」频道最新
- 腾讯混元 Hy4 预览:770B 总参 49B 激活,原生 1M 上下文 Apache 2.0 — aftahi_ai · 2026-09-05
- Qwen3.8 27B 量化版挤进 24GB 显存跑 10 万上下文,本地模型威胁前沿定价 — ChopSticksPlease · 2026-09-05
- Speechify CEO 谈自建数据中心、被 ElevenLabs 反超与千万美元人才战 — 20VC · 2026-09-05
- 他把本地 LLM 当 3D 打印机用:一年自写 12 个游戏、29 个游戏 Mod — Quebber · 2026-09-05
- 算力变现效率差 5 倍:智谱每兆瓦仅 800-1000 万美元,Anthropic/OpenAI 达 4000-5000 万 — zephyr_z9 · 2026-09-05
- 用户抱怨 AWS 每月自动扣 0.1 美元且用途不明 — kylegawley · 2026-09-05