Perplexity 开源级揭秘:embedding 服务比 vLLM 快 3-4.8 倍
inductionheads · x · 2026-09-05
Perplexity 发布研究博客,讲解其支撑 pplx-embed 系列 embedding 与 reranker 模型、EB 级搜索索引的 SoTA 服务基础设施。
核心洞察:embedding 模型的 serving 特征与 LLM 高度相似——批量索引是 compute-bound 的 prefill,在线查询是 memory-bound 的 decode,因此可以直接复用为大型 LLM 优化的 CUDA kernel,几乎零成本获得高效率。
运行时优化:
- 整模型 CUDA graphs 懒捕获,随引擎服务动态生成
- 用 Rust 实现 LazyTensor,让 CPU 调度与 GPU 执行重叠
效果:在 BGE-M3、128 token、单张 H200 的条件下,p50 延迟比 vLLM 低 3 倍,p99 低 4.8 倍。
所属事件:Perplexity 公开自研嵌入推理三层架构(8 条相关)→
「Infra」频道最新
- 一行代码提升 PyTorch 速度:set_float32_matmul_precision 值得设置 — code_star · 2026-09-05
- Nvidia 发布 PAIR:把闲置 PC 和 Mac 变成本地 AI 算力 — emmanuelvivier · 2026-09-05
- Stripe 据称以超 70 亿美元收购 AI 模型路由器 OpenRouter — emmanuelvivier · 2026-09-05
- llama.cpp 发布 v0.4.0:新增 Qwen3.8-Flash-Next 与稀疏注意力大更新 — solyarisoftware · 2026-09-05
- 开源工具 Magnitude:一条命令找出你的电脑能跑哪些本地模型 — solyarisoftware · 2026-09-05
- Omarchy「Burn Bar」可视化监控 Claude/Codex 用量与 GPU 状态 — DanWahlin · 2026-09-05