DeepSeek V4.1-Flash 将 KV 缓存压至每 token 890 字节
DeepSeek 随 V4.1-Flash 发布了一种大幅压缩 KV cache 内存占用的新方法,将每 token 的 KV cache 显存压缩到仅 890 字节,核心手段包括 CED 分离等技术。该模型主打长上下文效率,直接效果是可支持更大的上下文窗口,同时显著降低推理内存成本。有博主和 Reddit 用户对其架构进行了逐层拆解与分析。
2026-09-13 ~ 2026-09-13 · 2 条相关
- 第 1 集:DeepSeek V4.1 Flash 上线 Together AI,性能超 GPT-5.6 Sol 成本仅三分之一(2026-09-12,3 条)
- 第 2 集:TensorSharp 实测 DeepSeek V4.1 Flash,八卡A40性能亮眼(2026-09-13,2 条)
- 第 3 集:DeepSeek V4.1-Flash 将 KV 缓存压至每 token 890 字节(2026-09-13,2 条)
- DeepSeek V4.1 Flash 把 KV Cache 压到每 token 890 字节 — Prompt Engineering · 2026-09-13
- DeepSeek 发布 V4.1-Flash KV 缓存压缩法,大幅降低推理内存成本 — justlikemedics · 2026-09-13