YOCO 架构详解:DeepSeek-V4.1-Flash 用它把 KV Cache 压到极致

青稞AI · wechat · 2026-09-21

青稞AI 发布长文解析 YOCO 架构及其衍生变体,指出随着 DeepSeek-V4.1-Flash 发布,YOCO 重新进入大众视野。

YOCO 的两大动机

架构:把 decoder 拆成 Self-Decoder(可用 gated retention/滑窗,把上下文压成一份全局 KV)+ Cross-Decoder(各层用自己的 Query cross-attend 这份 KV);Prefill 完全不用跑后半部分,agent 场景超长输入下特别实用。

变体

DeepSeek-V4.1-Flash(YOCO/CED + CSA2 + SWA):40 层拆成 20 层 Causal Encoder + 20 层 Decoder,Prefill 只跑前 20 层;CSA2 分 Full/Reindex/Reuse 层跨层复用 Global KV 与 Top-K,稀疏注意力只读 Top-512 远程 KV;SWA KV 只放短 TTL 的 DRAM 池,丢失时只 replay 最后 128 token;Global 主 KV 用 FP4,SWA 用 FP8。

其他同类:Gemma4 E2B/E4B 后段层只保留独立 Q,复用前面同类型注意力层的 KV;WeLM 用 U 形 KV-Mirror 共享投影前的 Hidden States 以省 Prefill 计算(依据 KV Sharer 发现:共享差异更大的层性能反而更好)。

所属事件:传 DeepSeek-V4.1-Flash 采用 YOCO 架构引热议(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →