DSV4.1 把全局 KV 压到 890 字节,HBM 需求争论再起

teortaxesTex · x · 2026-09-12

分析师 HiCagr 拆解 DeepSeek V4.1 Flash 的 KV cache 优化后认为 HBM 容量瓶颈将不再是刚需:V4.1 Flash 通过 CSA2(跨层复用全局 KV、FP4 KV 缓存、Top-K 索引)和 SWA Bounded Replay(仅重放最近 nwin 个 token 重建 SWA 状态),把每 token 全局 KV 从约 3.5KB 降到 890 字节,持久 KV cache 占用降为 V4 Flash 的 1/8。

但 teortaxesTex 反驳称 HBM 需求并未消失:V4.1 同样渴望更大显存团队,跑多 agent 时 HBM 消耗会随规模回升——4 个 agent 时 V4.1 的 HBM 消耗/秒就超过 V4,64 个 agent 时超过 V3.2,「Jevons 悖论再次应验」。对于想跑本地集群/多智能体的人,这是关键取舍信息。

所属事件:DeepSeek V4.1 Flash 将 KV 缓存压至 890 字节(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →