DeepSeek V4.1 Flash 架构重置:KV 缓存缩至 1/4
DeepSeek 发布 V4.1 Flash,在模型体量约为前代两倍的情况下,将工作 KV 缓存压缩到 1/4、持久缓存存储降到 1/8,实测速度接近 420 tokens/s。多位独立评论者认为这是「AI 工程与研究的杰作」,架构解析者甚至认为其含金量足以称为「DeepSeek-V5 Flash」。该模型通过主动删除自家旧设计实现架构重置,长 agent 会话的缓存持有成本显著下降,但社区对 190B+ engram 查找表的机制仍有困惑。
已确认
- 知乎作者 Exhalation 拆解指出:尽管 V4.1 Flash 总参数与激活参数都比上一代更大,工作 KV cache 降到 1/4,持久缓存存储降到 1/8(bendee983 转述为 KV 存储从每 token 3514 字节降至 890 字节)。
- 核心做法:删除旧模块、共享 KV 状态并重算局部上下文。
- 模型采用分离式编码解码架构,具备极强的 prefill 优化,KV cache 规模巨大。
- 实测速度接近 420 tokens/s。
- 博主 zartbot 发布了对技术报告的长篇架构解析,认为其含金量足以称为「DeepSeek-V5 Flash」。
尚未确认
- 发帖人 NoAfternoon4260 求助式提问:500B+ 权重与 190B+ 的「engram 查找表」各自的作用是什么,核心疑问尚未得到权威解答。
为什么重要
- bendee983 指出,长 agent 会话的缓存持有成本更低,这对长上下文 agent 应用是直接利好。
- teortaxesTex 评论认为,DeepSeek 把注意力中二次方计算的部分不断上移、压缩到更精炼的操作里,不是小修小补,而是坦然接受「苦涩教训」——在自身科学框架内寻找全局计算的不可约最小原语,属于探索式架构研究路线。
2026-09-15 ~ 2026-09-17 · 5 条相关
一手来源
- DeepSeek V4.1 Flash 架构重置:KV 缓存缩至 1/4,主动删掉自家旧设计 — teortaxesTex ·
- DeepSeek-V4.1-Flash:KV 缓存降至 1/4,解码分离架构获盛赞 — bendee983 ·
- DeepSeek 不断上移二次方分量,被赞是「苦涩教训」式科学探索 — teortaxesTex ·
- DeepSeek V4.1 Flash 架构引困惑:500B 权重加 190B Engram 查找表怎么用 — No_Afternoon_4260 · 2026-09-15
- 【源头】DeepSeek V4.1 Flash 架构重置:KV 缓存缩至 1/4,主动删掉自家旧设计 — teortaxesTex · 2026-09-16
- 【源头】DeepSeek 不断上移二次方分量,被赞是「苦涩教训」式科学探索 — teortaxesTex · 2026-09-16
- 深度解析 DeepSeek-V4.1 Flash:把 KV Cache 压缩推到极限 — teortaxesTex · 2026-09-17
- 【源头】DeepSeek-V4.1-Flash:KV 缓存降至 1/4,解码分离架构获盛赞 — bendee983 · 2026-09-17