USC 提出 HeteroFold:跨模型家族 KV 缓存免预填充传输,32K 上下文快 10.7 倍
UniversityofSouthernCalifornia · hf · 2026-10-02
南加州大学团队提出 HeteroFold,解决多智能体 LLM 系统中的通信冗余:接收方通常要重新 prefill 发送方已处理的共享上下文。
- 方法在发送方与接收方均冻结的前提下,实现跨模型家族的 KV 缓存免预填充传输,处理 tokenization、模型深度和 KV 表示差异:对齐模型结构、将发送方缓存映射到接收方空间并校准以保持接收方行为
- 在 6 个传输方向上,HeteroFold 于全部 4 个长上下文基准及多数短上下文设置中取得最佳缓存传输性能,在多智能体基准上与文本通信持平
- 速度:32K 上下文下,Llama-3.1-8B → Ministral-3-14B 的传输比原生 prefill 快 10.7 倍,比此前最优免预填充基线(Dense Latent、KV Ridge)快 1.18–1.47 倍
「Infra」频道最新
- 传三星 HBM4 报价超 4 美元/Gb,达 HBM3E 三倍以上 — zephyr_z9 · 2026-10-02
- 开发者自研 Bobcat 推理引擎,主打 Apple Silicon 本地极速跑模型 — Available_Pressure47 · 2026-10-02
- 东芝斥资 600 亿日元扩产菲律宾工厂,AI 用 HDD 产能将翻倍 — zephyr_z9 · 2026-10-02
- 扎克伯格:多吉瓦级训练集群暴力堆算力即可逼近 AGI — rohanpaul_ai · 2026-10-02
- 1.3微秒CPU检测幻觉:120B大模型反而集体自信胡编 — More_Slide5739 · 2026-10-02
- 开源 CodexBar 上架菜单栏:22k 星,一屏看尽各家 AI 额度 — lxfater · 2026-10-02