清华开源 C2C:模型间免文本直连 KV-Cache 推理提速 2.5 倍

清华大学与无问芯穹等团队开源论文 C2C(Cache-to-Cache),已被 ICLR 2026 收录并开放代码。该范式让多智能体系统中的 LLM 协作时跳过文字解码,不再把内部「想法」翻译成文本 token 传递,而是通过轻量神经网络直接共享 KV-Cache 进行语义级通信,推理速度提升约 2.5 倍。

2026-09-18 ~ 2026-09-19 · 2 条相关