YOCO 架构详解:DeepSeek-V4.1-Flash 用它把 KV Cache 压到极致
青稞AI · wechat · 2026-09-21
青稞AI 发布长文解析 YOCO 架构及其衍生变体,指出随着 DeepSeek-V4.1-Flash 发布,YOCO 重新进入大众视野。
YOCO 的两大动机
- Prefill–Decode 不对称:只有最后一个 token 需要产生 logits,普通 Transformer 每层独立 KV Cache 浪费了这种不对称
- 从 Layer 维度压缩 KV Cache:GQA/MQA 压 entry、CSA/Linear 压 sequence,YOCO 让后面的 Cross-Decoder 共享同一份全局 Shared KV,从层数下手
架构:把 decoder 拆成 Self-Decoder(可用 gated retention/滑窗,把上下文压成一份全局 KV)+ Cross-Decoder(各层用自己的 Query cross-attend 这份 KV);Prefill 完全不用跑后半部分,agent 场景超长输入下特别实用。
变体
- YOCO-U:Self-Decoder 循环三次生成 Shared KV,Cross-Decoder 用 NOPE
- YOCO-Sparse:多个 Cross-Decoder 层连 Sparse Attention 的 Routing Index 也共享
DeepSeek-V4.1-Flash(YOCO/CED + CSA2 + SWA):40 层拆成 20 层 Causal Encoder + 20 层 Decoder,Prefill 只跑前 20 层;CSA2 分 Full/Reindex/Reuse 层跨层复用 Global KV 与 Top-K,稀疏注意力只读 Top-512 远程 KV;SWA KV 只放短 TTL 的 DRAM 池,丢失时只 replay 最后 128 token;Global 主 KV 用 FP4,SWA 用 FP8。
其他同类:Gemma4 E2B/E4B 后段层只保留独立 Q,复用前面同类型注意力层的 KV;WeLM 用 U 形 KV-Mirror 共享投影前的 Hidden States 以省 Prefill 计算(依据 KV Sharer 发现:共享差异更大的层性能反而更好)。
所属事件:传 DeepSeek-V4.1-Flash 采用 YOCO 架构引热议(2 条相关)→
「模型」频道最新
- Swift @Generable 设计者谈 SDK 与模型协同设计,让约束解码触达开发者 — rxwei · 2026-09-21
- 博主押注:未来四个月 OpenAI 将把 AI 做成实时交互 — imjustnewatai · 2026-09-21
- 报告称中国开源模型距美国前沿仅差 4.4 个月 — emmanuelvivier · 2026-09-21
- StepFun 发布 Step 5 Preview:600B 参数 MoE,100 万 token 上下文 — emmanuelvivier · 2026-09-21
- 260 万美元 RL 就近 SOTA:数据成本会否超过训练成本? — my_cat_can_code · 2026-09-21
- 模仿人类社交节奏:humansand 发布 Persimmon 模型与 Trickle Test — niloofar_mire · 2026-09-21