曝 DeepSeek V4.1 Flash 采用 YOCO 架构,KV 缓存数量级优化

donglixp · x · 2026-09-11

有爆料称 DeepSeek V4.1 Flash 的架构核心采用了 YOCO(You Only Cache Once)设计,继承其在 prefill 和 KV 缓存上的数量级优势,标记为 #decoderdecoder。YOCO 是 2024 年论文提出的 decoder-decoder 架构:自解码器高效编码全局 KV 缓存,交叉解码器通过交叉注意力复用,整体验 geometric仍表现为 decoder-only Transformer,但只缓存一次 KV。论文实验显示其在扩展模型规模与训练 token 量的各种设置下表现不输 Transformer,可扩展至 1M 上下文且大海捞针检索近乎完美,推理显存、prefill 延迟和吞吐均有数量级提升。该消息为可信爆料,官方尚未确认。

所属事件:DeepSeek V4.1 Flash 架构解析:YOCO 灵魂与 KV 缓存复用(7 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →