PReCache:免训练 KV 缓存共享,Multi-LoRA 智能体 TTFT 提速 3.1 倍
SNU-VLSI · hf · 2026-09-29
Multi-LoRA 智能体系统通过共享骨干模型实现角色特化,但每个 agent 都要重复处理不断增长的共享轨迹并自建 KV cache,长任务下冗余严重;直接复用上个 agent 的缓存还会削弱自身 LoRA 的角色行为。SNU-VLSI 提出免训练的 PReCache,包含两个设计:
- PreLRShared:在首次处理共享上下文时,用预训练权重计算基础缓存,并为每个 agent 预计算紧凑的低秩(LR)缓存,当前 agent 用自己的 LR 缓存,免去重复 prefill
- ReBaseShared:从无适配器的隐状态重建共享基础缓存,降低上个 agent 适配表征带来的误差;针对单流推理与并发服务提出两种重建时机
- 多模型多 agent 基准上,PreLRShared 相比无缓存共享 TTFT 提速最高 3.1 倍、单请求吞吐提升 2.3 倍;ReBaseShared 精度损失最小,平均仅降 1.1 分
「Infra」频道最新
- Qdrant 推出 Constella 研究预览,换查询嵌入模型无需重建全部向量 — qdrant_engine · 2026-09-29
- 124M 小模型配 65B embedding,研究员戏谑提出 AFED 分离架构 — YouJiacheng · 2026-09-29
- Oracle 30年期利差半年走阔至+180bp,新墨西哥Stargate园区因电力发不可抗力通知 — julsimon · 2026-09-29
- 贝恩:AI 需 2031 年前年入 6 万亿美元才够回本,缺口 4.2 万亿 — rohanpaul_ai · 2026-09-29
- 算账:Meta Muse 每用户成本 51 美元,免费模式难以为继 — bookwormengr · 2026-09-29
- KVCMAS:低秩在线修正 KV 缓存,多智能体共享上下文 TTFT 提速 2 倍 — SNU-VLSI · 2026-09-29