新方法宣称每 token KV 缓存体积再降 4 倍

zephyr_z9 · x · 2026-09-10

爆料称出现新的 KV 缓存压缩技术,宣称可让每 token 的 KV 缓存体积再缩小 4 倍,是推理内存优化的又一进展。原帖未附论文或技术细节,具体实现与验证情况待确认。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →