曝 DeepSeek V4.1 Flash 采用 YOCO 架构,KV 缓存数量级优化
donglixp · x · 2026-09-11
有爆料称 DeepSeek V4.1 Flash 的架构核心采用了 YOCO(You Only Cache Once)设计,继承其在 prefill 和 KV 缓存上的数量级优势,标记为 #decoderdecoder。YOCO 是 2024 年论文提出的 decoder-decoder 架构:自解码器高效编码全局 KV 缓存,交叉解码器通过交叉注意力复用,整体验 geometric仍表现为 decoder-only Transformer,但只缓存一次 KV。论文实验显示其在扩展模型规模与训练 token 量的各种设置下表现不输 Transformer,可扩展至 1M 上下文且大海捞针检索近乎完美,推理显存、prefill 延迟和吞吐均有数量级提升。该消息为可信爆料,官方尚未确认。
所属事件:DeepSeek V4.1 Flash 架构解析:YOCO 灵魂与 KV 缓存复用(7 条相关)→
「模型」频道最新
- Anthropic 指控月之暗面经 Claude 转发近 30 万条请求并冒充自研 — Polymarket · 2026-09-11
- John Schulman:用户数据训练对数学等前沿能力贡献极小 — soumitrashukla9 · 2026-09-11
- OpenAI 否认 Codex 提示影响训练,回击「偷用私聊数据」指控 — QuintinPope5 · 2026-09-11
- Claude 无故封禁付费企业客户,反而逼其摆脱单一厂商依赖 — AllOthersBringMeData · 2026-09-11
- GPT-6「Sol」疑似曝光,或于 DevDay 前后发布 — koltregaskes · 2026-09-11
- 前 OpenAI 员工断言:前沿模型都在拿成功对话免费微调 — burkov · 2026-09-11