PReCache:免训练 KV 缓存共享,Multi-LoRA 智能体 TTFT 提速 3.1 倍

SNU-VLSI · hf · 2026-09-29

Multi-LoRA 智能体系统通过共享骨干模型实现角色特化,但每个 agent 都要重复处理不断增长的共享轨迹并自建 KV cache,长任务下冗余严重;直接复用上个 agent 的缓存还会削弱自身 LoRA 的角色行为。SNU-VLSI 提出免训练的 PReCache,包含两个设计:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →