DeepSeek V4.1 Flash 技术报告解读:三层压缩让 552B 打败 1.6T
机器之心 · wechat · 2026-09-12
机器之心基于官方技术报告解读 DeepSeek-V4.1-Flash:一个 552B 主干 + 196B Engram 参数的多模态 MoE,以约 1/3 的参数量在 ArtificialAnalysis 评测中(40 分)超过 1.6T 参数的 V4 Pro,核心武器是把 KV 缓存压到极致——全局 KV 每 token 仅 890 字节(约为 V4-Flash 的 1/4、相对 V1 压缩 437 倍)。
三项关键技术:
- CED(因果编码器-解码器):40 层切成两半,解码器各层 KV 直接由第 20 层隐藏状态投影得到,prefill 只跑前 20 层,计算复杂度近对半砍(继承微软 YoCo 但为每层配独立投影)。
- CSA2 稀疏注意力:同时吃满条目、序列、层三个压缩维度,按层静态分配 Full/Reindex/Reuse 三种模式;配合 FP4 量化的 mainKV(E2M1 + 每 16 通道 E4M3 缩放)。
- SWA Bounded Replay:接受近似、只回放最近 128 个 token,把 SWA KV 赶出持久化缓存(改放 DRAM 池、TTL 几分钟),持久化 KV 降到 V4-Flash 的约 1/8。
其他要点: Single-Pass mHC 把激活访存减半;Engram 记忆模块首次进正式版,用 N-gram 哈希把静态知识卸载到主机内存;投机解码模块 DSpark 预训练后单独训练,同时加速线上服务与 RL rollout。后训练坦言「没有算法创新」,但引入 1-100 的 reasoning effort 标量:effort 从 25 提到 100,八个推理基准平均 Pass@1 从 67.1% 升到 76.3%,代价约 2.5 倍输出 token;API 的 max/high/low 三档对应 b=100/75/50。报告建议 max 只留给最难任务。评测还显示其以 69% 居 AutomationBench-AA 榜首(与 GPT-6 Astra 持平),虽然冗长度高(每任务 89k token),但每任务成本仅 0.27 美元。上下文从 4K 扩到 1M,单 token decode FLOPs 只增 1/4。
「Infra」频道最新
- Mooncake 成头部 LLM 推理引擎默认 KV 缓存方案 — zhyncs42 · 2026-09-12
- 实测 MiniMax H3 视频生成:4090 租 GPU 单条低至 1.3 美分 — Worldly_North_7213 · 2026-09-12
- EUV 光罩供应链图曝光,Park Systems 在 AFM 市场击败 Bruker — PAstynome · 2026-09-12
- 美光 HBM 产能年内翻倍至月 10 万片,冲击三星 SK 海力士双寡头 — zephyr_z9 · 2026-09-12
- Wafer 发布最全 AI 性能工程资源库,首篇深拆 Transformer 推理 — garrytan · 2026-09-12
- 16GB 5060 Ti 本地实测 MiniMax H3 Director:23 秒视频跑 24 分钟 — thatguyjames_uk · 2026-09-12