跨层共享 KV 缓存新思路,与 Looped Models II 并行探索推理省显存
BlackHC · x · 2026-10-06
作者介绍其并行于 Huang 等人《Looped Models Done Right, Part II》的 KV 缓存复用研究。两篇工作都探索减少推理时 KV cache 占用,但技术路线不同:
- Looped Models II:研究 terminal KV 复用(每个物理层只保留一份缓存)、可学习的训练深度先验与正交注入。
- 作者方案:在核心 block 之间共享 KV 缓存以进一步降低显存占用,并研究 donor 一致性(donor consistency)问题。
作者表示目前受算力限制,欢迎同行联系合作,并附上论文链接。这条讨论对关注长上下文/推理显存优化的研究者有参考价值。
所属事件:BlackHC 离职首作:共享 KV cache 的绑定 Transformer(8 条相关)→
「Infra」频道最新
- 电力缺口成数据中心扩张瓶颈:2030 年需求激增、基建跟不上 — DavidLinthicum · 2026-10-06
- Beam 首个模型开源:501B-A23B 文本 MoE,Apache 2.0 全栈放发 — brandondamos · 2026-10-06
- Vultr 斥资 12 亿美元订购 AMD Helios AI 机架,客户提前数年锁算力 — shashib · 2026-10-06
- NanoGPT speedrun 刷新纪录:速度提升 11.3%,论文即将发布 — yoavartzi · 2026-10-06
- NVIDIA CANTO:直接从 CAD 参数化曲面预测气动场 — JeanKossaifi · 2026-10-06
- Epoch 估算:2027 年底算力可支撑数亿乃至数十亿 AI 智能体 — Jsevillamol · 2026-10-06