KV-cache grafting:冻结小模型也能变强
Corbenci · hf · 2026-07-17
## 用 KV-cache grafting 把冻结小模型变得更便宜也更强 这篇工作提出一种不改权重就能提升小模型能力、同时降低推理成本的方法:把已验证的知识以**字节精确(byte-exact)**的 KV 状态存起来,之后再 graft 回新的推理上下文中。 ### 核心特性 - 恢复是**位级一致**的:在固定确定性配置下,graft 后的 logits 与重新计算结果字节完全一致 - 论文在 **12B** 和 **31B** 两个模型尺度、两个 GPU 目标上验证了 byte-exact 性 - 还给出了 committed input/output hashes 方便复核 ### 结果 - 在 **AIME 2025** 上,冻结的 Gemma-4-12B 从 **80.0%** 提升到 **93.3%** - 在 recurring case 上,8 道原本 401,026 token 预算下都解不出的题,可用缓存验证解答在 **61 个 decode token** 内完成 - 文中声称这相当于 **6,574 倍更少 token**、约 **8,700x 更低能耗** - 可用上下文长度从 **32,768** 扩大到 **2,854,766 token**,且不增加额外 accelerator 内存 作者把它描述成一种“verified-knowledge flywheel”:知识一次验证,多次复用。
「Infra」频道最新
- DeepSWE 数据显示,多模型级联兼顾覆盖率与成本 — ZainHasan6 · 2026-07-21
- SALT 用 trie 压缩长上下文,降低 LLM 运行成本 — No_Sky9786 · 2026-07-21
- 一篇 GPU 升级指南对比 H200 和 B200,并附基准代码 — StasBekman · 2026-07-21
- ComfyUI 基准显示 NVFP4 可加速 Flux 和 Qwen-Image 等模型 — Certain-Will-2769 · 2026-07-21
- 分析称华为 Ascend 950DT 可能在能效上超过 B300 — teortaxesTex · 2026-07-21
- OpenRouter 动态路由帮 2.2 万用户节省超 10 万美元 — gajesh · 2026-07-21