DeepSeek V4.1-Flash 将 KV 缓存压至每 token 890 字节,持久缓存缩 8 倍

jbhuang0604 · x · 2026-10-01

Cornell 教授黄仁杰(Jonathan Huang?—— jbhuang0604)解读 DeepSeek V4.1-Flash 的注意力架构:该模型将全局 KV 缓存压缩到每 token 仅 890 字节,持久缓存缩小 8 倍,同时在智能体类 benchmark 上保持竞争力。

支撑这一压缩率的三个关键技术:

对长上下文和 agent 场景的推理成本优化有直接意义,视频中有逐步拆解。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →