清华开源 C2C:模型间跳过文字直连 KV-Cache,推理提速 2.5 倍
anselm · x · 2026-09-19
清华大学与无问芯穹等团队开源论文 C2C(Cache-to-Cache),已被 ICLR 2026 收录,代码开源。核心思路:多智能体系统中模型间通信不再经过文本解码,而是用轻量神经网络(Neural Fuser)把模型 A 的 KV-Cache 高维旋转对齐后直接融入模型 B 的 KV-Cache,省去逐字解码和重新前缀计算的开销。
- 可学习门控:不同模型层数结构不同,Gate 机制动态决定哪些层吸收外部缓存、哪些层保持独立
- 成绩:推理速度提升 2.0–2.5 倍;综合问答准确率较单模型最高提升 14.2%;比传统文本交互的多 Agent 协作高出约 5%
- 意义:保留了被文字压缩丢弃的语义细节,挑战了「LLM 必须用人类语言交流」的多 Agent 范式
所属事件:清华开源 C2C:模型间免文本直连 KV-Cache 推理提速 2.5 倍(2 条相关)→
「编程与Agent」频道最新
- DSPy 团队推出零依赖轻量库 lm15,替代 litellm 调用多模型 — lateinteraction · 2026-09-19
- Clairvoyance 集成 Jev:让持久记忆 Agent 快速召回合适上下文 — draginol · 2026-09-19
- Claude Code 桌面版不会静音浏览器,agent 突然放视频吓人 — scaling01 · 2026-09-19
- 判定模型 Jev 实战六种用法:事实核查 24/24 全对,中位延迟仅 0.41 秒 — alexisgallagher · 2026-09-19
- NVIDIA 论文 SoL-Pi 自动进化 agent harness,省近半 token 与 1/3 API 成本 — omarsar0 · 2026-09-19
- AI 视频剪辑正从内容生成转向工作流自动化 — OwlZealousideal4779 · 2026-09-19