KVCMAS:低秩在线修正 KV 缓存,多智能体共享上下文 TTFT 提速 2 倍

SNU-VLSI · hf · 2026-09-29

提示词特化的多智能体系统让多个 agent 共享一个模型,但各 agent 的专属前缀会改变共享上下文的 KV cache,导致反复 prefill 和多份缓存的高开销。SNU-VLSI 提出 KVCMAS 在线 KV cache 修正框架:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →