DeepSeek-V4.1-Flash 架构详解:非对称编码器-解码器与 CSA2 注意力
teortaxesTex · x · 2026-09-11
DeepSeek 最新技术报告引入全新架构 DeepSeek-V4.1-Flash,推文作者 arjunkocher 及转述者据架构图做了逐层拆解:
- 非对称因果编码器-解码器(CED):40 层网络分为各 20 层的因果编码器与解码器,并非 BERT/T5 式结构——每个生成 token 仍走全部 40 层;差别在读 prompt:解码器全局 KV 从编码器末层隐状态投影而来,prompt 只需 20 层编码器加 128 token 的解码器 replay。每 token 激活 prefill 8B / decode 16B 参数,prefill 计算近乎减半。
- CSA2(Compressed Sparse Attention 2):前两层编码器用滑动窗口注意力(SWA),其余用 CSA2;CSA2 有 Full/Reindex/Reuse 三种模式,跨层复用主 KV 与 Top-K 索引。编码器模式为 SWA、SWA、再 [Full+5 Reuse]×3;解码器为 Full+3 Reuse 后 [Reindex+3 Reuse]×4。共享 KV 降缓存存储,复用 Top-K 省索引计算。V4.1 弃用了 V4 的 CSA–HCA 混合,改用纯 CSA2。
- 其他组件:FFN 全部用标准 DeepSeekMoE;引入此前工作中的条件记忆模块 Engram,把记忆与计算解耦(对近期 2-gram、3-gram 等做哈希索引);另含 Single-Pass mHC、DSpark 与 Hierarchical Sparse Indexer。
整体看,这是一个以省 KV cache 和 prefill 算力为核心的长上下文效率架构,是目前对 DeepSeek 新架构最详细的一份公开拆解。
所属事件:DeepSeek V4.1 Flash 技术解读:KV cache 压缩架构全拆解(9 条相关)→
「模型」频道最新
- ValsAI 发布 RSI Index:首个第三方基准测试模型自研继任能力 — JenniferHli · 2026-09-11
- 实测者评 Devin 新模型:非最强但执行力强,$20 订阅超值 — brandon_galang · 2026-09-11
- Business Insider 问 ChatGPT、Gemini、Claude、Grok:AI 如何毁灭人类 — coinfanking · 2026-09-11
- 爆料称 Kimi 曾用 Claude 原始思维链蒸馏,网友讽其山寨 Claude — xuanalogue · 2026-09-11
- 用户切回 GPT-5.6:省用量且体感更快 — CtrlAltDwayne · 2026-09-11
- 开发者观点:好的封装下模型差异很小,Grok 4.6 够用 — gnukeith · 2026-09-11