清华开源 C2C:模型间跳过文字直连 KV-Cache,推理提速 2.5 倍

anselm · x · 2026-09-19

清华大学与无问芯穹等团队开源论文 C2C(Cache-to-Cache),已被 ICLR 2026 收录,代码开源。核心思路:多智能体系统中模型间通信不再经过文本解码,而是用轻量神经网络(Neural Fuser)把模型 A 的 KV-Cache 高维旋转对齐后直接融入模型 B 的 KV-Cache,省去逐字解码和重新前缀计算的开销。

所属事件:清华开源 C2C:模型间免文本直连 KV-Cache 推理提速 2.5 倍(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →