DeepSeek 自曝 CED 架构灵感来自 2024 年 YoCo 论文
jm_alexia · x · 2026-09-10
转发者指出,DeepSeek 引用 2024 年的 YoCo(You Only Cache Once)论文作为其 Causal-Encoder Decoder(CED)transformer 模块的主要灵感来源。
- YoCo 的 decoder-decoder 架构:模型拆成上下两半。下半 Self-Decoder 用带因果掩码的高效注意力(如 SWA)处理输入序列,产出一个共享的全局 KV cache;上半 Cross-Decoder 不自己计算 KV 对,而是在每一层对这一个全局 KV cache 做交叉注意力。
- 核心价值:"只缓存一次"——昂贵的全局 KV 对只算一次并在所有上层复用,而非每层独立重算,大幅降低推理显存与成本。
- 作者称这就是 DeepSeek-4.1 的"secret sauce",并感慨 Encoder-Decoder 架构的复兴出乎其 2026 年的预料。
所属事件:DeepSeek 回归 encoder-decoder 架构,CED 灵感源自 YoCo 论文(3 条相关)→
「模型」频道最新
- NeoHorse-1-4B 冲上 Hugging Face 热门,主打智能体与工具调用 — TokenRhythm · 2026-09-10
- DeepSeek V4.1-Flash 引热议:552B 参数对标 GPT-5.6 — teortaxesTex · 2026-09-10
- 国产模型3D夜店实测:DeepSeek V4.1F氛围感碾压 — teortaxesTex · 2026-09-10
- DeepSeek 4.1 Flash现身Boeing榜:成绩未出 — victormustar · 2026-09-10
- Sentry CEO 实测:高阶订阅推理模型表现并不比常规旗舰强 — zeeg · 2026-09-10
- 最新模型已能熟练搞定 ffmpeg 音视频处理任务 — Flomerboy · 2026-09-10