NVIDIA 研究:KV cache 跨模型直传,小模型记忆迁移到大模型免重算

anselm · x · 2026-09-24

NVIDIA 研究人员提出一种跨模型直接迁移 KV cache 的方法,解决了 LLM 服务中「换模型必须重 prefill」的痛点。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →