DeepSeek V4.1 Flash 技术解读:KV cache 压缩架构全拆解
DeepSeek 在 V4.1 Flash 技术报告中公布了一个以 KV cache 压缩为核心设计目标的旗舰级模型,@nrehiew 随后发布系列技术长文逐层拆解,@demianai 转发的 Mhr1036 分析与 @teortaxesTex 转发的 arjunkocher 架构详解也给出互补视角。社区共识是:该模型通过架构层面的多项创新,同时压低了长上下文的计算与内存开销。
已确认
- 模型为 552B 参数 MoE 骨干,支持百万 token 上下文窗口;Mhr1036 指出长上下文带来「为保留上下文付费」的第二重成本,而该设计同时压缩计算与内存两端
- 核心架构为非对称因果编码器-解码器(CED/decoder-decoder):40 层网络分为下半 20 层 encoder 与上半 20 层 decoder;@nrehiew 解释这是针对 prefill 昂贵问题的方案——下半层生成 KV cache,经逐层投影后共享给上半层,可理解为一种 YOCO 式 decoder-decoder 结构,将 KV cache 减半;arjunkocher 的拆解也确认了这一非对称设计,并提到 CSA2 注意力
- 全局注意力本质是升级版压缩注意力:三种 KV 复用变体(不复用、复用早层 KV 等)都先在小 KV 上跑 indexer 做选择,再与窗口化 KV 拼接后进入注意力
- 注意力 indexer 本身也是稀疏的:第一个 full mode indexer 先选出候选,后续层用这些候选打分,形成分层筛选结构
- 优化器采用 head-wise Muon(含视觉模型部分);sparse attention 无需 warmup、从头训练,并配合 Sinkhorn 平衡
- 多模态方面:45T 图文 token 预训练、自研 Siglip 风格图像编码器、模态级 load balancing(@nrehiew 认为这让人联想到原始 Chameleon 的做法)
- 训练基建:一个模态计算时可并行 all-gather 另一模态的特征,对超长多图序列应用 CP(context parallelism);部署稀疏 indexer 专用集群
为什么重要
@nrehiew 的主线判断是「对 KV cache 压缩的偏执」造就了这个超高效的旗舰模型:在百万 token 上下文成为标配的趋势下,KV cache 的读写与内存成本成为主要瓶颈,V4.1 Flash 展示了一条从架构(非对称 CED、KV 复用)、算法(稀疏分层 indexer、压缩注意力)到训练(Muon、Sinkhorn、负载均衡)的系统性降本路径,对长上下文与多模态前沿模型的工程化具有参考价值。
2026-09-11 ~ 2026-09-11 · 9 条相关
- 第 1 集:DeepSeek V4.1 Flash 限时内测:新架构原生多模态(2026-09-08,18 条)
- 第 2 集:DeepSeek V4.1 Flash实测:极速350 tokens/s但偏实验性(2026-09-08,2 条)
- 第 3 集:DeepSeek V4-Flash 降价并改峰谷计费,9 月 10 日生效(2026-09-08,6 条)
- 第 4 集:DeepSeek V4.1 Flash 多场景实测:近前沿性能、超低成本(2026-09-09,15 条)
- 第 5 集:DeepSeek 发布 V4.1-Flash:552B MoE 低价反超旗舰(2026-09-09,56 条)
- 第 6 集:DeepSeek V4.1 Flash 爆料:552B 非对称架构对标 GPT-5.6(2026-09-10,20 条)
- 第 7 集:DeepSeek V4.1 Flash 评测跑分流出,社区热议实测表现(2026-09-10,2 条)
- 第 8 集:Bug Hunt Bench 实测 105 个真实 bug,DeepSeek Flash 性价比突出(2026-09-10,8 条)
- 第 9 集:DeepSeek V4.1 Flash 架构解析:YOCO 灵魂与 KV 缓存复用(2026-09-10,7 条)
- 第 10 集:DeepSeek V4.1 Flash 技术解读:KV cache 压缩架构全拆解(2026-09-11,9 条)
- 第 11 集:DeepSeek 新模型技术报告:KV Cache 缩小 4 倍(2026-09-11,3 条)
- 第 12 集:DeepSeek V4.1 Flash 登顶 Vals 开源榜,成本仅 0.3 美元(2026-09-11,2 条)
- 第 13 集:DeepSeek V4.1 Flash 评测得 40 分,幻觉率上升仍领先开源(2026-09-11,2 条)
- 第 14 集:DeepSeek CED 与 GLM 的 KV 缓存复用机制解析(2026-09-11,4 条)
一手来源
- DeepSeek V4.1 Flash 技术深读:死磕 KV cache 压缩造就高效前沿模型 — nrehiew_ ·
- DeepSeek V4.1 Flash 用 YOCO 式 decoder-decoder 把 KV cache 减半 — nrehiew_ ·
- DeepSeek-V4.1-Flash 架构详解:非对称编码器-解码器与 CSA2 注意力 — teortaxesTex ·
- 【源头】DeepSeek-V4.1-Flash 架构详解:非对称编码器-解码器与 CSA2 注意力 — teortaxesTex · 2026-09-11
- DeepSeek V4.1 Flash 架构解析:552B MoE 读写算力不对称省上下文成本 — demian_ai · 2026-09-11
- 【源头】DeepSeek V4.1 Flash 技术深读:死磕 KV cache 压缩造就高效前沿模型 — nrehiew_ · 2026-09-11
- DeepSeek V4.1 Flash 多模态:45T 图文 token 预训练加模态级负载均衡 — nrehiew_ · 2026-09-11
- 【源头】DeepSeek V4.1 Flash 用 YOCO 式 decoder-decoder 把 KV cache 减半 — nrehiew_ · 2026-09-11
- DeepSeek V4.1 Flash 的全局注意力:三种 KV 复用变体的压缩注意力 — nrehiew_ · 2026-09-11
- DeepSeek V4.1 Flash 稀疏 indexer 也是稀疏的,分层候选筛选 — nrehiew_ · 2026-09-11
- DeepSeek V4.1 Flash 用 Muon 优化器,196B 参数 Engram 配 Sinkhorn 平衡 — nrehiew_ · 2026-09-11
- DeepSeek V4.1 Flash 基建细节:Siglip 式视觉编码器与稀疏 indexer 集群 — nrehiew_ · 2026-09-11