DeepSeek V4.1 Flash 技术报告解读:三层压缩让 552B 打败 1.6T

机器之心 · wechat · 2026-09-12

机器之心基于官方技术报告解读 DeepSeek-V4.1-Flash:一个 552B 主干 + 196B Engram 参数的多模态 MoE,以约 1/3 的参数量在 ArtificialAnalysis 评测中(40 分)超过 1.6T 参数的 V4 Pro,核心武器是把 KV 缓存压到极致——全局 KV 每 token 仅 890 字节(约为 V4-Flash 的 1/4、相对 V1 压缩 437 倍)。

三项关键技术:

其他要点: Single-Pass mHC 把激活访存减半;Engram 记忆模块首次进正式版,用 N-gram 哈希把静态知识卸载到主机内存;投机解码模块 DSpark 预训练后单独训练,同时加速线上服务与 RL rollout。后训练坦言「没有算法创新」,但引入 1-100 的 reasoning effort 标量:effort 从 25 提到 100,八个推理基准平均 Pass@1 从 67.1% 升到 76.3%,代价约 2.5 倍输出 token;API 的 max/high/low 三档对应 b=100/75/50。报告建议 max 只留给最难任务。评测还显示其以 69% 居 AutomationBench-AA 榜首(与 GPT-6 Astra 持平),虽然冗长度高(每任务 89k token),但每任务成本仅 0.27 美元。上下文从 4K 扩到 1M,单 token decode FLOPs 只增 1/4。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →