CacheBack 按接收方需求压缩 KV cache:少传 75% 状态,准确率提升 14.7 个点
Maximillian Rossi · hf · 2026-10-05
多智能体系统中,文本消息传递会丢失证据且需解码;直接传 KV cache 又会随上下文和智能体数量线性膨胀,超出 GPU 内存与上下文窗口限制。
作者提出接收方条件化通信(receiver-conditioned communication):发送方先拿到接收方的一小段信息需求描述,据此过滤压缩要传的 KV cache。训练无关的 CacheBack 实现基于发送方的注意力权重完成筛选。
在 FanOutQA 上,CacheBack + Qwen 3 只传 25% 的状态(削掉 75%),准确率比文本通信提高 14.7 个百分点,中位任务完成延迟降低 3.2 倍,且在稠密 Transformer、Mamba-attention 混合、滑窗注意力等多类模型上均有类似提升。
「编程与Agent」频道最新
- tok_mcp:用 MCP 服务器让 AI 先做架构设计再写代码 — modelcontextprotocol · 2026-10-05
- Hugging Face 把 Claude Code、Codex 等 10 个编码工具变成 RL 训练环境 — huggingface · 2026-10-05
- Grok 视频 + Wan + AE + Blender 混合工作流做出音乐视频特效 — Tranchillo · 2026-10-05
- 用家里四台设备组多智能体:编排者加 worker 的本地部署设想 — Jebbyk1 · 2026-10-05
- AI Gateway 接入 Exa、Ceramic、Linkup 搜索源,统一计费与观测 — michellechen · 2026-10-05
- 自研 AI 智能体的工具检索难:BM25、Gemma 向量都试过了 — GarageObjective6015 · 2026-10-05