DeepSeek V4.1 Flash 用 YOCO 式 decoder-decoder 把 KV cache 减半
nrehiew_ · x · 2026-09-11
nrehiew 讲 DeepSeek V4.1 Flash 最核心的设计:20 层 encoder + 20 层 decoder。针对 prefill 昂贵的问题,下半层生成 KV cache,经逐层投影后共享给上半层——可理解为一种被后层各自读取的状态。设计灵感来自 YOCO,因此被称为 decoder-decoder(两个模块均因果掩码),SWA 层不适用此结构。
所属事件:DeepSeek V4.1 Flash 技术解读:KV cache 压缩架构全拆解(9 条相关)→
「Infra」频道最新
- DeepSeek-V4.1-Flash 登陆 Ollama:763B MoE、1M 上下文,主打 KV cache 压缩 — ollama · 2026-09-11
- 作者自制 KiCad 封装库,让 AI 芯片 DIY 原型板更好布线 — debreuil · 2026-09-11
- 从业者爆料:LLM 推理服务商毛利极薄,月营收1万美元仅赚200美元 — metalvendetta · 2026-09-11
- kimi k3 或采用同置异步 RL,v4 批次不变性设计引猜测 — stochasticchasm · 2026-09-11
- Peter Diamandis:AI 竞赛正变成我们这代最大的基建工程 — PeterDiamandis · 2026-09-11
- k3报告细节:数百万并发沙盒的RL训练规模确认 — stochasticchasm · 2026-09-11