Perplexity 批调度层 Tulip:CUDA graphs 加 LazyTensors 压延迟提吞吐

perplexity_ai · x · 2026-09-05

Perplexity 官方介绍 Rust gRPC 推理服务器 Tulip:位于 Ivy 与 ROSE 引擎之间,收集请求、组批后送 GPU。对小型嵌入模型,运行时间取决于 token 数而非查询数,约 512 token 即可填满 GPU。两项降延迟提吞吐技术:CUDA graphs 预录制 GPU 工作单次启动以减少 CPU 开销;LazyTensors 异步追踪结果,让 CPU 在 GPU 完成当前批次时准备下一批。

所属事件:Perplexity 公开自研嵌入推理三层架构(8 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →