KV-cache grafting:冻结小模型也能变强
Corbenci · hf · 2026-07-17
用 KV-cache grafting 把冻结小模型变得更便宜也更强
这篇工作提出一种不改权重就能提升小模型能力、同时降低推理成本的方法:把已验证的知识以字节精确(byte-exact)的 KV 状态存起来,之后再 graft 回新的推理上下文中。
核心特性
- 恢复是位级一致的:在固定确定性配置下,graft 后的 logits 与重新计算结果字节完全一致
- 论文在 12B 和 31B 两个模型尺度、两个 GPU 目标上验证了 byte-exact 性
- 还给出了 committed input/output hashes 方便复核
结果
- 在 AIME 2025 上,冻结的 Gemma-4-12B 从 80.0% 提升到 93.3%
- 在 recurring case 上,8 道原本 401,026 token 预算下都解不出的题,可用缓存验证解答在 61 个 decode token 内完成
- 文中声称这相当于 6,574 倍更少 token、约 8,700x 更低能耗
- 可用上下文长度从 32,768 扩大到 2,854,766 token,且不增加额外 accelerator 内存
作者把它描述成一种“verified-knowledge flywheel”:知识一次验证,多次复用。
「Infra」频道最新
- 影子算力市场走向台前,Meta 对外出售过剩 GPU 算力成标志性信号 — DavidLinthicum · 2026-09-11
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11