NVIDIA 新方法让 KV 缓存跨模型复用,转换比重新 prefill 快 2.7-25 倍

blaizedsouza · x · 2026-09-09

NVIDIA 团队发布论文,提出跨模型 KV cache 迁移:模型家族内切换大小模型时,目标模型可复用源模型的 KV cache,完全跳过 prefill,转换速度比重算上下文快 2.7 到 25 倍。

关键发现与做法:

对成本侧意义重大:cache read 按约 10% 基础输入价计费是推理服务最大的成本杠杆之一,跨模型缓存复用能把这一杠杆扩展到模型路由、大小模型级联和对话中途切换等场景。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →