DeepSeek V4.1-Flash 将 KV 缓存压至每 token 890 字节,持久缓存缩 8 倍
jbhuang0604 · x · 2026-10-01
Cornell 教授黄仁杰(Jonathan Huang?—— jbhuang0604)解读 DeepSeek V4.1-Flash 的注意力架构:该模型将全局 KV 缓存压缩到每 token 仅 890 字节,持久缓存缩小 8 倍,同时在智能体类 benchmark 上保持竞争力。
支撑这一压缩率的三个关键技术:
- Causal Encoder- Decoder:因果编码器-解码器结构
- Compressed Sparse Attention:压缩稀疏注意力
- SWA Bounded Replay:滑动窗口有界回放
对长上下文和 agent 场景的推理成本优化有直接意义,视频中有逐步拆解。
「Infra」频道最新
- Qwen-Image 2.1 提示词增强节点提速 4.4 倍,8GB 显存可跑 — mozophe · 2026-10-01
- 不走双系统不开虚拟机:WSL 里跑通 Omarchy 桌面,支持 GPU 加速 4K — sytelus · 2026-10-01
- 散户建仓 Cerebras:押注推理时代 SRAM 替代 HBM 的低延迟路线 — Sethwinterroth · 2026-10-01
- Cerebras 被曝潜力超 200 亿美元:OpenAI 付费档验证推理速度价值 — Sethwinterroth · 2026-10-01
- MLX-Serve 26.10.1 发布:Qwen3.8 27B 推理提速最高 66% — TheMoonMidas · 2026-10-01
- 约 11150 颗 Starlink 卫星在轨,V3 部署将再上台阶 — XFreeze · 2026-10-01