DeepSeek V4.1 Flash 把 KV Cache 压到每 token 890 字节
Prompt Engineering · youtube · 2026-09-13
DeepSeek 发布主打长上下文效率的 V4.1 Flash,博主逐层拆解其架构:KV cache 显存被压缩到每 token 仅 890 字节,核心手段包括 CED 分离、CSA2 层共享与 4-bit 量化重放,大幅降低长上下文的内存与算力开销。
视频重点:
- 为什么 KV cache 是长上下文成本的最大瓶颈
- Prefill 与 Decode 两阶段的计算差异
- 架构改动如何支撑长时运行 agent 与超大代码库场景
- Benchmark 对比:效率亮眼,但能力仍落后前沿系统
「Infra」频道最新
- 企业 AI 落地成本账:私有云可能比超大规模云便宜数倍 — DavidLinthicum · 2026-09-13
- 麒麟 9050 Pro 实测约 A17 Pro 水平,7nm 工艺对标初代 3nm — teortaxesTex · 2026-09-13
- Astra 高推理档 ARC-AGI-3 更强,成本反而省 46% — daniel_mac8 · 2026-09-13
- DeepSeek v4.1 flash 缓存命中率惊人,超长会话下成本优势凸显 — teortaxesTex · 2026-09-13
- 埃森哲报告:企业 AI token 支出不足两成可量化对应财务回报 — TansuYegen · 2026-09-13
- 「Hugging Bay」上线:索引约 14.9 万公开 AI 模型,附许可证与 SHA-256 哈希 — johnseach · 2026-09-13