跨层共享 KV 缓存新思路,与 Looped Models II 并行探索推理省显存

BlackHC · x · 2026-10-06

作者介绍其并行于 Huang 等人《Looped Models Done Right, Part II》的 KV 缓存复用研究。两篇工作都探索减少推理时 KV cache 占用,但技术路线不同:

作者表示目前受算力限制,欢迎同行联系合作,并附上论文链接。这条讨论对关注长上下文/推理显存优化的研究者有参考价值。

所属事件:BlackHC 离职首作:共享 KV cache 的绑定 Transformer(8 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →