DeepSeek-V4.1-Flash:KV 缓存降至 1/4,解码分离架构获盛赞
bendee983 · x · 2026-09-17
- DeepSeek 发布 V4.1-Flash,被评者称为「AI 工程与研究的杰作」。模型体量约为前代两倍,KV 存储却从每 token 3514 字节降至 890 字节,长 agent 会话持有成本更低。
- 核心亮点是分离式 encoder-decoder 架构:prefill 只用一半层数,decode 用全量层数,把「读」和「写」拆开处理。
- 其他关键数据:输入激活 8B、输出激活 16B 参数;缓存命中价 $0.006/百万 token;评测 40 分(对比 Gemini 41);百万 token 会话全局 KV 控制在 1GB 内(前代约需 3.5GB);不再把本地窗口状态落盘,持久 SSD 缓存降至约 1/8。
- 评价:KV cache 提速与效率优化做得扎实,预计将如以往 DeepSeek 发布一样,为开源架构树立新标杆。
所属事件:DeepSeek V4.1 Flash 架构重置:KV 缓存缩至 1/4(5 条相关)→
「Infra」频道最新
- 本地推理慢?推测解码用小模型起草、大模型批量验证 — HowDevelop · 2026-09-17
- 印度拟投约 300 亿美元建设本土半导体产业 — Polymarket · 2026-09-17
- 受 AgentConf 演讲启发,开发者计划在家用 Blackwell GPU 本地跑 Agent — TejasKumar_ · 2026-09-17
- 深度解析 DeepSeek-V4.1 Flash:把 KV Cache 压缩推到极限 — teortaxesTex · 2026-09-17
- 四项调度技术压平 MoE 长上下文训练内存峰值,1M 上下文吞吐提升 10 倍 — Shrey Pandit · 2026-09-17
- 两周上线:GLM 智能体自建推理基建,端到端吞吐提升 3.2 倍 — jietang · 2026-09-17