Perplexity 自研引擎 ROSE:嵌入推理跳过 KV cache 改用 ragged attention

perplexity_ai · x · 2026-09-05

Perplexity 官方介绍模型引擎 ROSE:LLM 与嵌入模型复用同一套 kernel;嵌入推理时跳过 KV cache,用 ragged attention 替代 paged attention。ROSE 支持多个注意力后端,kernel 选择依模型形状和序列长度而定。

所属事件:Perplexity 公开自研嵌入推理三层架构(8 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →