绑定省 40% 参数仅 +0.04 nats:最后 10% 训练做 KV 匹配可消除八成惩罚
BlackHC · x · 2026-10-06
前 DeepMind 研究员离职后的第一个(短小且算力受限)研究项目:一个 LSTM 风格的绑定 Transformer,只保留一份共享的核心 KV 缓存,核心问题是如何针对推理时递归产生的缓存历史进行训练。关键发现:
- 宽度 1024 下,绑定把参数从 228.5M 降到 136.2M(参考前向 FLOPs 相近),连续损失仅 +0.0438 nats;tied-1024 在约 136M 参数下用 1.66 倍参考前向 FLOPs 胜过 untied-768(单种子结果)。
- 一个小小的训练改动效果显著:在训练最后 10% 匹配两次传递的 donor 键值,在宽度 512/768/1024 下消除 81-89% 的主连续惩罚,全缓存损失仅上升 0.0011-0.0025 nats,token 预算不变。
- 不需要 LSTM 式 carry 也有效:宽度 512 试点中,donor 一致性对门控 carry、普通递归、输入注入分别带来 -0.1374 / -0.0814 / -0.0271 nats 改善(单种子,不构成架构排名)。
- 自适应深度是负结果:状态余弦停机规则平均选 4.75 次传递、损失 3.3816,比固定深度 4(3.3761)更差。
- 新鲜数据阶梯实验显示低 token 预算下绑定代价更小,留下开放问题:共享缓存模型能否保留多 epoch 增益。
所属事件:BlackHC 离职首作:共享 KV cache 的绑定 Transformer(8 条相关)→
「Infra」频道最新
- 电力缺口成数据中心扩张瓶颈:2030 年需求激增、基建跟不上 — DavidLinthicum · 2026-10-06
- Beam 首个模型开源:501B-A23B 文本 MoE,Apache 2.0 全栈放发 — brandondamos · 2026-10-06
- Vultr 斥资 12 亿美元订购 AMD Helios AI 机架,客户提前数年锁算力 — shashib · 2026-10-06
- NanoGPT speedrun 刷新纪录:速度提升 11.3%,论文即将发布 — yoavartzi · 2026-10-06
- NVIDIA CANTO:直接从 CAD 参数化曲面预测气动场 — JeanKossaifi · 2026-10-06
- Epoch 估算:2027 年底算力可支撑数亿乃至数十亿 AI 智能体 — Jsevillamol · 2026-10-06