DeepSeek V4.1-Flash 将 KV 缓存压至每 token 890 字节

DeepSeek 随 V4.1-Flash 发布了一种大幅压缩 KV cache 内存占用的新方法,将每 token 的 KV cache 显存压缩到仅 890 字节,核心手段包括 CED 分离等技术。该模型主打长上下文效率,直接效果是可支持更大的上下文窗口,同时显著降低推理内存成本。有博主和 Reddit 用户对其架构进行了逐层拆解与分析。

2026-09-13 ~ 2026-09-13 · 2 条相关

事件全程(共 3 集)→