DeepSeek V4.1 Flash 再改 Transformer:回走编解码结构、CSA2 跨层复用

evijit · x · 2026-09-10

据中文 KOL MaxForAI 对 DeepSeek V4.1 Flash 论文结构图的分析(未经官方确认),这次真正值得关注的不是参数或跑分,而是 DeepSeek 又对 Transformer 本体动刀,至少有三大架构变化:

一、回归 Encoder + Decoder 非对称结构

V4.1 Flash 采用 20 层 Causal Encoder + 20 层 Decoder:Encoder 负责读取、理解和压缩输入,输入侧仅激活 8B;Decoder 负责推理生成,输出侧激活 16B。核心思路:读 100 万 token 和生成下一个 token 是不同的计算任务,不必用同一套结构。

二、CSA 升级为 CSA2,注意力跨层复用

三种模式:Full(KV 和 Top-K Index 全部重算)、Reindex(复用 KV,只重新决定关注哪些 token)、Reuse(连 KV 和 Top-K Index 都复用)。运行序列形如 Full → Reuse → Reuse → Reindex……判断依据是:「哪些 token 值得关注」没必要每层重算,能缓存就缓存。

三、Engram 回归

一套 Conditional Memory(条件记忆),用于固定搭配、实体、局部模式等静态知识。

evijit 评价:DeepSeek 持续做架构级创新并以开源方式公开,抬高了整个 AI 研究生态的技术下限。

所属事件:DeepSeek 新模型回归 encoder-decoder 架构并开源(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →