NVIDIA 研究:KV cache 跨模型直传,小模型记忆迁移到大模型免重算
anselm · x · 2026-09-24
NVIDIA 研究人员提出一种跨模型直接迁移 KV cache 的方法,解决了 LLM 服务中「换模型必须重 prefill」的痛点。
- 问题:对话中途从小模型切换到大模型时,大模型必须从头重算全部历史,延迟和算力开销巨大。
- 发现:同一家族不同规模的模型(如 Qwen3 14B 与 32B)之间,KV cache 存在线性关系——小模型的单层输出即可预测大模型 keys 约 56% 的方差。
- 做法:研究构建了「闭式线性映射」,把小模型的记忆直接映射到大模型,无需重新读取 prompt,从根本跳过 prefill。
- 意义:若可扩展到更多模型家族,将显著降低推理切换成本与首 token 延迟。
「Infra」频道最新
- 开发者用编码 Agent 在 H100 上跑 Miles 训练并提交首个 PR — VoidAsuka · 2026-09-24
- 工业界快速跟进:MRC 多路径可靠连接回应超大规模 RDMA 论文 — thoefler · 2026-09-24
- 报告:亚马逊美国数据中心容量接近翻倍,比微软多 69% — anselm · 2026-09-24
- 纯 JVM 跑 NVIDIA Parakeet:1 小时音频 44 秒转录,比 C++ 参考实现快 2 倍 — mkheck · 2026-09-24
- 用 Ollama 本地跑开源模型,零订阅复刻 Claude Code 工作流 — Aiden_Tech_Ai · 2026-09-24
- _xjdr:TPU 表现出色并非理所当然,是时候看看 v8s 了 — _xjdr · 2026-09-24