DeepSeek V4.1 Flash 再改 Transformer:回走编解码结构、CSA2 跨层复用
evijit · x · 2026-09-10
据中文 KOL MaxForAI 对 DeepSeek V4.1 Flash 论文结构图的分析(未经官方确认),这次真正值得关注的不是参数或跑分,而是 DeepSeek 又对 Transformer 本体动刀,至少有三大架构变化:
一、回归 Encoder + Decoder 非对称结构
V4.1 Flash 采用 20 层 Causal Encoder + 20 层 Decoder:Encoder 负责读取、理解和压缩输入,输入侧仅激活 8B;Decoder 负责推理生成,输出侧激活 16B。核心思路:读 100 万 token 和生成下一个 token 是不同的计算任务,不必用同一套结构。
二、CSA 升级为 CSA2,注意力跨层复用
三种模式:Full(KV 和 Top-K Index 全部重算)、Reindex(复用 KV,只重新决定关注哪些 token)、Reuse(连 KV 和 Top-K Index 都复用)。运行序列形如 Full → Reuse → Reuse → Reindex……判断依据是:「哪些 token 值得关注」没必要每层重算,能缓存就缓存。
三、Engram 回归
一套 Conditional Memory(条件记忆),用于固定搭配、实体、局部模式等静态知识。
evijit 评价:DeepSeek 持续做架构级创新并以开源方式公开,抬高了整个 AI 研究生态的技术下限。
所属事件:DeepSeek 新模型回归 encoder-decoder 架构并开源(3 条相关)→
「模型」频道最新
- DeepSeek V4.1 论文获赞:像全领域的教科书,先讲数据后讲基建 — teortaxesTex · 2026-09-10
- 实测:Google AI Mode 未登录用户引用来源三周内锐减 72% — gaganghotra_ · 2026-09-10
- DeepSeek 自曝 CED 架构灵感来自 2024 年 YoCo 论文 — jm_alexia · 2026-09-10
- DeepSeek 效率研究将成本压降超 10 倍,架构成降价唯一数学变量 — ChengleiSi · 2026-09-10
- DeepSeek 发布非对称新架构:552B MoE,输入仅激活 8B — ChengleiSi · 2026-09-10
- 13 步手推 Switch Transformer:看懂 MoE 为何省算力 — ProfTomYeh · 2026-09-10