Tessera 论文:检索驱动 KV 缓存复用,RAG 服务首字延迟降 3.6 倍

_reachsumit · x · 2026-09-29

arXiv 新论文 Tessera 提出面向 RAG 与检索式智能体记忆的 LLM 服务系统。核心动机:同一段被检索内容会以不同 prompt 位置、不同前缀上下文出现在多个请求中,常规前缀缓存无法复用;作者刻画发现,在智能体记忆负载中,出现在匹配前缀之外的重复记录占注入记忆 token 的 70% 以上。可组合 KV 复用虽可行,但在线服务带来管理难题:某个复用单元的 KV 状态可能尚未生成、已被逐出或在其他节点上。

Tessera 将检索作为 KV 复用的控制平面:利用模型执行前已知的检索单元,结合当前需求、检索历史、KV 驻留位置与生成负载,统一协调缓存管理与请求路由;生成节点并发准备本地缓存、远程缓存与缺失状态,新计算的状态在请求关键路径之外保留。实验中,Tessera 在相同请求速率下相对 SGLang 与带 EPIC 的 LMCache 将平均 TTFT 降低至多 3.6 倍,并在基线饱和的速率下维持低延迟,同时保持回答质量。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →