Cache-to-Cache 论文:让 LLM 直接用 KV 缓存互相交流

rochansinha · hn · 2026-09-19

arXiv 论文提出 Cache-to-Cache(C2C)方法,让大语言模型之间不再通过文本生成来沟通,而是直接进行语义层面的通信:将一个模型的 KV 缓存通过映射变换注入另一个模型的缓存空间,实现「缓存到缓存」的信息传递。这种方法绕开了「生成文本→解析」的信息瓶颈,作者声称在多模型协作任务上相比文本通信可降低延迟并提升效果,为多智能体系统的模型间通信提供了新范式。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →