NVIDIA 新方法让 KV 缓存跨模型复用,转换比重新 prefill 快 2.7-25 倍
blaizedsouza · x · 2026-09-09
NVIDIA 团队发布论文,提出跨模型 KV cache 迁移:模型家族内切换大小模型时,目标模型可复用源模型的 KV cache,完全跳过 prefill,转换速度比重算上下文快 2.7 到 25 倍。
关键发现与做法:
- LLM API 无状态,每轮都要重发全部对话并按输入计费;prompt caching 只在本模型有效,因为 key/value 依赖模型权重,换模型就得重算 prefill。
- 作者发现跨模型 KV 存在显著线性结构:在匹配 KV 对上,单层线性映射可解释 Qwen3 14B→32B 目标层 keys 方差的 56%、values 的 32%;用多层源做输入时提升到 79% 和 65%。
- 方法是一个按 head 运作的闭式 ridge 映射,分三步:为每个目标层选取 top-k 最具预测性的源层并拼接其 KV 作为输入;从 keys 中剥离 RoPE 后再做线性映射。
对成本侧意义重大:cache read 按约 10% 基础输入价计费是推理服务最大的成本杠杆之一,跨模型缓存复用能把这一杠杆扩展到模型路由、大小模型级联和对话中途切换等场景。
「Infra」频道最新
- Palantir 任命 Nebius 为首选主权 AI 基础设施合作伙伴 — pdamodaran · 2026-09-09
- GLM-5.3-Flash Q4 在 M3 Ultra 提速至 300k 上下文 37.4 t/s — IngeniousIdiocy · 2026-09-09
- 德州超级工厂Cybercab批量下线,首次大规模搭载星链模块 — NinaDSchick · 2026-09-09
- 96GB 显存跑 Qwen3.8-Flash-Next:llama.cpp 调参实测 15t/s — HlddenDreck · 2026-09-09
- 嵌入式向量库实战对比:ChromaDB、LanceDB、Qdrant Edge 各自的坑 — InsideDebt6345 · 2026-09-09
- 密歇根博士生 Jae-Won Chung 入选 MIT TR35,用 Zeus 软件为 AI 省电 — radamihalcea · 2026-09-09