Perplexity 开源级揭秘:embedding 服务比 vLLM 快 3-4.8 倍

inductionheads · x · 2026-09-05

Perplexity 发布研究博客,讲解其支撑 pplx-embed 系列 embedding 与 reranker 模型、EB 级搜索索引的 SoTA 服务基础设施。

核心洞察:embedding 模型的 serving 特征与 LLM 高度相似——批量索引是 compute-bound 的 prefill,在线查询是 memory-bound 的 decode,因此可以直接复用为大型 LLM 优化的 CUDA kernel,几乎零成本获得高效率。

运行时优化:

效果:在 BGE-M3、128 token、单张 H200 的条件下,p50 延迟比 vLLM 低 3 倍,p99 低 4.8 倍。

所属事件:Perplexity 公开自研嵌入推理三层架构(8 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →