CacheBack 按接收方需求压缩 KV cache:少传 75% 状态,准确率提升 14.7 个点

Maximillian Rossi · hf · 2026-10-05

多智能体系统中,文本消息传递会丢失证据且需解码;直接传 KV cache 又会随上下文和智能体数量线性膨胀,超出 GPU 内存与上下文窗口限制。

作者提出接收方条件化通信(receiver-conditioned communication):发送方先拿到接收方的一小段信息需求描述,据此过滤压缩要传的 KV cache。训练无关的 CacheBack 实现基于发送方的注意力权重完成筛选。

在 FanOutQA 上,CacheBack + Qwen 3 只传 25% 的状态(削掉 75%),准确率比文本通信提高 14.7 个百分点,中位任务完成延迟降低 3.2 倍,且在稠密 Transformer、Mamba-attention 混合、滑窗注意力等多类模型上均有类似提升。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →