清华开源 C2C:模型间免文本直连 KV-Cache 推理提速 2.5 倍
清华大学与无问芯穹等团队开源论文 C2C(Cache-to-Cache),已被 ICLR 2026 收录并开放代码。该范式让多智能体系统中的 LLM 协作时跳过文字解码,不再把内部「想法」翻译成文本 token 传递,而是通过轻量神经网络直接共享 KV-Cache 进行语义级通信,推理速度提升约 2.5 倍。
2026-09-18 ~ 2026-09-19 · 2 条相关
- 中国团队开源 Cache-to-Cache:LLM 免文字直接语义通信 — Scobleizer · 2026-09-18
- 清华开源 C2C:模型间跳过文字直连 KV-Cache,推理提速 2.5 倍 — anselm · 2026-09-19