Tessera 论文:检索驱动 KV 缓存复用,RAG 服务首字延迟降 3.6 倍
_reachsumit · x · 2026-09-29
arXiv 新论文 Tessera 提出面向 RAG 与检索式智能体记忆的 LLM 服务系统。核心动机:同一段被检索内容会以不同 prompt 位置、不同前缀上下文出现在多个请求中,常规前缀缓存无法复用;作者刻画发现,在智能体记忆负载中,出现在匹配前缀之外的重复记录占注入记忆 token 的 70% 以上。可组合 KV 复用虽可行,但在线服务带来管理难题:某个复用单元的 KV 状态可能尚未生成、已被逐出或在其他节点上。
Tessera 将检索作为 KV 复用的控制平面:利用模型执行前已知的检索单元,结合当前需求、检索历史、KV 驻留位置与生成负载,统一协调缓存管理与请求路由;生成节点并发准备本地缓存、远程缓存与缺失状态,新计算的状态在请求关键路径之外保留。实验中,Tessera 在相同请求速率下相对 SGLang 与带 EPIC 的 LMCache 将平均 TTFT 降低至多 3.6 倍,并在基线饱和的速率下维持低延迟,同时保持回答质量。
「Infra」频道最新
- Lambda 算力供不应求:H100 常缺货,突发负载按小时计费为闲置买单 — YvesMulkers · 2026-09-29
- Bittensor 128 个子网中 23 个已盈利,上月 GPU 网络流水 96.4 万美元 — bittingthembits · 2026-09-29
- 换掉矩阵乘法不改参数:结合代数层让 110M 模型吞吐提升 7.8% — Ilya Koziev · 2026-09-29
- Shaw 吐槽反数据中心者:一边骂算力一边上网自相矛盾 — zealcaiden · 2026-09-29
- 模型推演 2030 年十亿 Agent 虚拟机背后的 CPU 需求与芯片商机 — AccBalanced · 2026-09-29
- Venice 代币化推理积分模式遭跟风,供给过剩隐忧浮现 — 0xJeff · 2026-09-29