DSV4.1 把全局 KV 压到 890 字节,HBM 需求争论再起
teortaxesTex · x · 2026-09-12
分析师 HiCagr 拆解 DeepSeek V4.1 Flash 的 KV cache 优化后认为 HBM 容量瓶颈将不再是刚需:V4.1 Flash 通过 CSA2(跨层复用全局 KV、FP4 KV 缓存、Top-K 索引)和 SWA Bounded Replay(仅重放最近 nwin 个 token 重建 SWA 状态),把每 token 全局 KV 从约 3.5KB 降到 890 字节,持久 KV cache 占用降为 V4 Flash 的 1/8。
但 teortaxesTex 反驳称 HBM 需求并未消失:V4.1 同样渴望更大显存团队,跑多 agent 时 HBM 消耗会随规模回升——4 个 agent 时 V4.1 的 HBM 消耗/秒就超过 V4,64 个 agent 时超过 V3.2,「Jevons 悖论再次应验」。对于想跑本地集群/多智能体的人,这是关键取舍信息。
所属事件:DeepSeek V4.1 Flash 将 KV 缓存压至 890 字节(2 条相关)→
「Infra」频道最新
- 全球廉价电力争夺战:AI 数据中心该建在哪,训练与推理答案不同 — pravchaw · 2026-09-12
- 用股权融资买算力本末倒置,风投圈提议发明「硬件收入衍生品」 — ns123abc · 2026-09-12
- Relace 单日处理 1 万亿 token,占 DeepSeek v4 Flash 37% 流量 — stuffyokodraws · 2026-09-12
- Yutori 浏览器 agent 单任务成本 1.46 美元,不到前沿模型 1/10 — DhruvBatra_ · 2026-09-12
- 编译器自动推导 FlashAttention:含 SMEM 与 Tensor Core 分配 — vtabbott_ · 2026-09-12
- 算力决定 AI 进度:若十年前爆发,现有硬件红利将一次性兑现 — cis_female · 2026-09-12