「因果编码器-解码器」名不副实?DeepSeek V4.1 架构被指更像 YOCO
donglixp · x · 2026-09-10
针对 DeepSeek V4.1 被称为「Causal Encoder-Decoder」架构,开发者 aHapBean 提出不同看法,认为这一说法夸大了架构上的革新:
- V4.1 可能仍是 decoder-only LLM,更准确的描述是 YOCO 风格的 KV 复用设计(You Only Cache Once)
- 所谓「编码器」其实是联合训练的因果 Transformer 下半部分——decoder-only 模型的浅层本就在功能上承担编码器角色,为深层构建上下文表示
- 上层共享来自中间表示的全局 KV,使大部分 prompt token 在 prefill 时可跳过上层计算,这是实质性的效率改进
- 整个堆栈仍端到端训练,「编码器-解码器」的说法容易让人误以为是两个独立网络
所属事件:DeepSeek V4.1 Flash 架构解析:YOCO 灵魂与 KV 缓存复用(7 条相关)→
「模型」频道最新
- Business Insider 问 ChatGPT、Gemini、Claude、Grok:AI 如何毁灭人类 — coinfanking · 2026-09-11
- 爆料称 Kimi 曾用 Claude 原始思维链蒸馏,网友讽其山寨 Claude — xuanalogue · 2026-09-11
- 用户切回 GPT-5.6:省用量且体感更快 — CtrlAltDwayne · 2026-09-11
- 开发者观点:好的封装下模型差异很小,Grok 4.6 够用 — gnukeith · 2026-09-11
- DeepSeek-V4.1-Flash 登陆 Ollama:763B MoE、1M 上下文,主打 KV cache 压缩 — ollama · 2026-09-11
- Anthropic 发布最详细威胁情报报告,曝 Claude 遭滥用案例 — typewriters · 2026-09-11