DeepSeek 九个月将每 token KV 缓存体积压缩 54 倍
zephyr_z9 · x · 2026-09-10
据 X 用户 zephyrz9 分享,DeepSeek 在过去 9 个月里把每 token 的 KV 缓存体积压缩了 54 倍,显示出其在推理效率与内存优化上的快速迭代。KV 缓存是长上下文推理内存占用的主要来源,如此幅度的压缩意味着同等硬件可服务更长的上下文或更高并发。
「Infra」频道最新
- 5 小时被扣 8.2 万美元账单:Google Cloud 用户遭天价扣费 — Patient_Election2179 · 2026-09-10
- TRL 发布百万 token 长上下文训练指南,单节点训通 Qwen3-8B — QGallouedec · 2026-09-10
- 双 RTX Pro 6000 + Threadripper 9955W 本地跑大模型,配置求把关 — No_Run8812 · 2026-09-10
- 截图显示 V4 时代 KV cache 机制存在 72 小时限制 — zephyr_z9 · 2026-09-10
- vLLM 完整支持 DeepSeek-V4.1-Flash 新架构,含投机解码与 PD 分离 — vllm_project · 2026-09-10
- 评论者称其推理架构复杂到基础设施商难以复制,建议自建可抽成 10-20% — zephyr_z9 · 2026-09-10