WhiteMatter:跨层共享 KV 让各层读取任意深度,省一半缓存不降性能
INK-USC · hf · 2026-09-30
- 动机:Transformer 每层只能使用同深度的历史 token 表示,限制了已计算信息的复用。
- 方法:WhiteMatter 允许每一层读取过去 token 在任意深度的表示,由可学习的 mixer 挑选当前上下文最有用的层深,并将其组合进跨层共享的 KV cache 通道;通道共享还能缩小缓存。
- 结果:同样训练 token 量下,全尺寸缓存的 WhiteMatter 相当于多 50% 层数的标准 Transformer;KV 缓存减半时,在最大 1.3B 两个规模上仍胜过对标的标准模型。
- 工程问题:跨层依赖拖慢训练与预填充,作者提出 cyclic iteration(交错 token 分组轮流更新、组内并行),在精确自回归执行的参考模型上比标准 Jacobi 迭代收敛快 12.5 倍。
「Infra」频道最新
- 自研引擎跑小米 1T 参数模型达 1300 tok/s — bookwormengr · 2026-09-30
- AMD 讲解用 AI agent 通宵自动调优 GPU 内核性能 — AnushElangovan · 2026-09-30
- 计算初创 Efficient 获 9700 万美元 B 轮,从物理 AI 扩展到数据中心 — Sethwinterroth · 2026-09-30
- 开发者抱怨 OpenAI 挪用付费用户算力打造消费级新产品 — arthurcolle · 2026-09-30
- Prime Intellect 首批部署 NVIDIA Vera CPU,主打 agent 工作负载 — eliebakouch · 2026-09-30
- 马斯克对话黄仁勋:电力即 GDP,SpaceX 拟建 10GW 算力、瞄准轨道计算 — tctjr · 2026-09-30