KV 压至 890 字节/token:DeepSeek V4.1 Flash 显存需求降 3.9 倍

teortaxesTex · x · 2026-09-10

博主分析 DeepSeek V4.1 Flash 的工程突破:KV cache 压缩到 890 字节/token,百万 token 不足 1GB,相比 V4-Flash HBM 需求再降 3.9 倍、SSD 需求降 8 倍,而且半年过去仍没有其他模型接近 V4 架构的 KV cache 效率。按 96GB 显存/950DT 的最低配置估算,可在华为集群上并行跑约 130 万个满预算 agent。作者称其毛利率超过 90%,认为这种效率提升在美国实验室会被称作「RSI(递归自我改进)」。

所属事件:DeepSeek V4.1 曝 552B 非对称激活架构(15 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →