KVCMAS:低秩在线修正 KV 缓存,多智能体共享上下文 TTFT 提速 2 倍
SNU-VLSI · hf · 2026-09-29
提示词特化的多智能体系统让多个 agent 共享一个模型,但各 agent 的专属前缀会改变共享上下文的 KV cache,导致反复 prefill 和多份缓存的高开销。SNU-VLSI 提出 KVCMAS 在线 KV cache 修正框架:
- 用紧凑的低秩状态表示跨 agent 的缓存偏差,沿 agent 工作流链式传递修正,无需额外参考 prefill
- 支持动态变化的共享上下文,同时保证首个 agent 缓存的精确性
- 多种语言与视觉-语言负载下,精度持平或优于此前 KV cache 共享方法,高并发服务下 TTFT 最低
- 受控服务轨迹下,相比无缓存共享推理 TTFT 提速 2.0 倍,峰值显存较此前修正方法最多降低 3.7 倍
「Infra」频道最新
- Transformers 原生支持运行 llama.cpp GGUF 量化模型 — ariG23498 · 2026-09-29
- Uber Eats 排序模型每秒 800 万次预测,工程团队公开特征一致性方案 — AxSaucedo · 2026-09-29
- Qdrant 推出 Constella 研究预览,换查询嵌入模型无需重建全部向量 — qdrant_engine · 2026-09-29
- 124M 小模型配 65B embedding,研究员戏谑提出 AFED 分离架构 — YouJiacheng · 2026-09-29
- Oracle 30年期利差半年走阔至+180bp,新墨西哥Stargate园区因电力发不可抗力通知 — julsimon · 2026-09-29
- 贝恩:AI 需 2031 年前年入 6 万亿美元才够回本,缺口 4.2 万亿 — rohanpaul_ai · 2026-09-29