DeepSeek 九个月将每 token KV 缓存体积压缩 54 倍

zephyr_z9 · x · 2026-09-10

据 X 用户 zephyrz9 分享,DeepSeek 在过去 9 个月里把每 token 的 KV 缓存体积压缩了 54 倍,显示出其在推理效率与内存优化上的快速迭代。KV 缓存是长上下文推理内存占用的主要来源,如此幅度的压缩意味着同等硬件可服务更长的上下文或更高并发。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →