BlackHC 离职首作:共享 KV cache 的绑定 Transformer
前 Google DeepMind 研究员 BlackHC 发布其离职后的第一个研究项目(他自述为短小且算力受限的小型项目):一种 LSTM 风格的绑定(tied)Transformer,全模型只保留一份共享的核心 KV cache,核心问题是如何针对模型在推理时递归产生的缓存历史进行训练。
已确认
- 工作建立在三条已有路线之上:LCKV(末层 cache + KV 匹配)、CLA(跨层复用)与 Huginn(循环深度),并用 LSTM 单元在绑定核心中测试 cache-history mismatch 及其修复方法,论文链接已发布。
- 关键实验数字:绑定节省约 40% 参数,仅带来 +0.04 nats 的损失;在训练最后 10% 阶段进行 KV 匹配,可消除约八成的训练-推理失配惩罚。
- donor 一致性修复不依赖 LSTM 式 carry 同样有效:宽度 512 的试点实验中,该方法对门控 carry、普通递归和输入注入三种变体分别带来 -0.1374、-0.0814 和 -0.0271 nats 的损失改善。
- 负面结果:以状态余弦相似度作为停机规则的自适应深度方案,固定深度 4 损失为 3.3761,自适应停机平均选择 4.75 次传递、损失 3.3816——损失更差且选择的深度反而更多;作者提醒这不是实测 FLOP。
- 新鲜数据阶梯实验显示:低 token 预算下参数绑定的损失代价更小,暗示循环架构的多 epoch 增益与数据复用相关;作者留待后续研究共享缓存模型的相应表现。
- 该研究与 Huang 等人《Looped Models Done Right, Part II》并行且相互独立,两者都旨在减少推理时 KV cache 显存占用,但技术路线不同。
为什么重要
- KV cache 的显存占用是当前推理成本的重要瓶颈,跨层/循环复用 KV cache 是降低推理开销的活跃方向,该工作提供了绑定权重+递归缓存训练的系统性实证数据。
- 作者指出即使算力受限的小型实验也能量化 cache-history mismatch 的来源与可修复程度,其中 donor 一致性修复的变体泛化性为后续更大规模验证提供了方法参考。
2026-10-06 ~ 2026-10-06 · 8 条相关
一手来源
- 前 DeepMind 研究员离职首作:共享核心 KV cache 的绑定 Transformer — BlackHC ·
- 共享 KV cache Transformer 论文发布,融合 LCKV/CLA/Huginn 三条路线 — BlackHC ·
- 绑定省 40% 参数仅 +0.04 nats:最后 10% 训练做 KV 匹配可消除八成惩罚 — BlackHC ·
- 【源头】前 DeepMind 研究员离职首作:共享核心 KV cache 的绑定 Transformer — BlackHC · 2026-10-06
- 【源头】绑定省 40% 参数仅 +0.04 nats:最后 10% 训练做 KV 匹配可消除八成惩罚 — BlackHC · 2026-10-06
- 不靠 LSTM 式传递也有效:donor 一致性修复降低冷启动损失 — BlackHC · 2026-10-06
- 循环复用架构红利有限:新鲜数据下参数绑定的损失代价更小 — BlackHC · 2026-10-06
- 自适应深度停机规则负结果:损失更差、选的深度反而更多 — BlackHC · 2026-10-06
- LSTM 式共享缓存 Transformer:递归推理下的 KV 缓存匹配实验 — BlackHC · 2026-10-06
- 【源头】共享 KV cache Transformer 论文发布,融合 LCKV/CLA/Huginn 三条路线 — BlackHC · 2026-10-06
- 跨层共享 KV 缓存新思路,与 Looped Models II 并行探索推理省显存 — BlackHC · 2026-10-06