网传 DeepSeek-V4.1-Flash 技术报告:552B MoE 主打百万级上下文的 KV 缓存压缩
burkov · x · 2026-09-11
Andriy Burkov 称 DeepSeek-4.1-Flash 的技术报告已可在线阅读(注意:该发布未获官方确认,真实性存疑,请以 DeepSeek 官方渠道为准)。按帖中描述:
- 动机:长程 agent 工作负载成本攀升——长输入推高 prefill 计算,巨大 KV 缓存挤占高带宽内存与存储带宽,成为百万 token 上下文模型更便宜普及的主要障碍。
- 技术组合:Causal Encoder-Decoder 布局、Compressed Sparse Attention 2 中的跨层 KV 与索引复用、FP4 主 KV 存储、滑窗状态的有界重放方案。
- 规模:5520 亿参数骨干,在 45 万亿多模态 token 上预训练,随后进行常规 SFT。
- 目标是在推理、agent、视觉任务上性能提升的同时,把 KV 缓存压缩到远低于此前水平的多模态 MoE 模型。
所属事件:DeepSeek V4.1 Flash 技术报告解读:架构级死磕 KV cache 压缩(10 条相关)→
「模型」频道最新
- 用户吐槽 Opus 5 不可用:开到最强仍想方设法不按指令做事 — RexDouglass · 2026-09-11
- 编程 Pareto 前沿仅剩 Muse Spark 1.3 与 Fable 5.1 — jyangballin · 2026-09-11
- 用户吐槽 Anthropic 过度拦截:古籍与递归 AI 查询也被挡 — NickPassig · 2026-09-11
- Codex 做网络安全工作需切换 Daybreak 模型,否则会被安全护栏拦截 — HankYeomans · 2026-09-11
- 传 DeepSeek 新模型霸榜开源:比 GLM、Kimi 便宜 4-10 倍,Codeforces 第六 — anselm · 2026-09-11
- GPT-6 Astra 从视频看懂并重建 Cessna 起落架机械结构 — FinanceYF5 · 2026-09-11