KV-cache grafting:冻结小模型也能变强

Corbenci · hf · 2026-07-17

## 用 KV-cache grafting 把冻结小模型变得更便宜也更强 这篇工作提出一种不改权重就能提升小模型能力、同时降低推理成本的方法:把已验证的知识以**字节精确(byte-exact)**的 KV 状态存起来,之后再 graft 回新的推理上下文中。 ### 核心特性 - 恢复是**位级一致**的:在固定确定性配置下,graft 后的 logits 与重新计算结果字节完全一致 - 论文在 **12B** 和 **31B** 两个模型尺度、两个 GPU 目标上验证了 byte-exact 性 - 还给出了 committed input/output hashes 方便复核 ### 结果 - 在 **AIME 2025** 上,冻结的 Gemma-4-12B 从 **80.0%** 提升到 **93.3%** - 在 recurring case 上,8 道原本 401,026 token 预算下都解不出的题,可用缓存验证解答在 **61 个 decode token** 内完成 - 文中声称这相当于 **6,574 倍更少 token**、约 **8,700x 更低能耗** - 可用上下文长度从 **32,768** 扩大到 **2,854,766 token**,且不增加额外 accelerator 内存 作者把它描述成一种“verified-knowledge flywheel”:知识一次验证,多次复用。

所属事件:KV缓存拼接法瞄准冻结小模型增强(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →