DeepSeek V4.1 Flash 将 KV 缓存压至 890 字节
DeepSeek V4.1 Flash 将 KV cache 压缩至每 token 890 字节,比 V1 缩小 437 倍,其 CSA2 跨层复用机制是关键。分析师 HiCagr 认为 HBM 容量瓶颈将不再是刚需,这直接触及中国 AI 算力的内存瓶颈问题,也再度引发业界对 HBM 需求前景的争论。
2026-09-10 ~ 2026-09-12 · 2 条相关
- KV 缓存比 V1 小 437 倍:V4.1 Flash 直击中国算力内存瓶颈 — ChrisGPT · 2026-09-10
- DSV4.1 把全局 KV 压到 890 字节,HBM 需求争论再起 — teortaxesTex · 2026-09-12