深度解析 DeepSeek-V4.1 Flash:把 KV Cache 压缩推到极限
teortaxesTex · x · 2026-09-17
博主 zartbot 发布了对 DeepSeek-V4.1 Flash 技术报告的长篇架构解析,认为其含金量足以称为「DeepSeek-V5 Flash」。
核心背景:V4.1 Flash 上线后实测速度接近 420 tokens/s,随后 DeepSeek 宣布 V4 Pro 系列全部下线,说明这不只是后训练小版本,而是架构级换代。
关键优化点:
- Prefill 计算优化:借鉴 YOCO 思路,全模型 40 层,Prefill 只需过 20 层,Prefill 激活参数仅 8B,Decode 激活 16B;
- KV Cache 压缩:从 GQA 式头数压缩、CSA 式分块压缩,到本文的 CSA2 跨层压缩,并优化 Sparse Attention 的 indexer 计算;
- 数值精度:采用 FP4 KV Cache;
- 动机是长程 Agent 工作流使上下文持续变长、工具调用带来巨大 prefill 压力,HBM 与外置 SSD 的 KV Cache 存储压力已成为 scaling 瓶颈。
所属事件:DeepSeek V4.1 Flash 架构重置:KV 缓存缩至 1/4(5 条相关)→
「Infra」频道最新
- 本地推理慢?推测解码用小模型起草、大模型批量验证 — HowDevelop · 2026-09-17
- 印度拟投约 300 亿美元建设本土半导体产业 — Polymarket · 2026-09-17
- 受 AgentConf 演讲启发,开发者计划在家用 Blackwell GPU 本地跑 Agent — TejasKumar_ · 2026-09-17
- 四项调度技术压平 MoE 长上下文训练内存峰值,1M 上下文吞吐提升 10 倍 — Shrey Pandit · 2026-09-17
- 两周上线:GLM 智能体自建推理基建,端到端吞吐提升 3.2 倍 — jietang · 2026-09-17
- 华为发布昇腾960 芯片与超节点全家桶,冲向百万卡集群 — 智东西 · 2026-09-17