DeepSeek-V4.1-Flash 上线 API:KV 缓存省 7/8,V4-Pro 将被淘汰
deepseek_ai · x · 2026-09-10
DeepSeek 官宣 V4.1-Flash 正式上线 DeepSeek API(模型名 deepseek-flash),并披露迁移与降本细节:
- 旧模型退役:V4-Flash 与 V4-Flash-Vision-Exp 下线,旧模型名暂时路由到 V4.1-Flash 保证兼容
- 多方测试显示 V4.1-Flash 在性能、成本、速度和总运行时长上全面领先旗舰 V4-Pro,V4-Pro 将被逐步淘汰;9 月 14 日 04:00 UTC 起,所有 deepseek-v4-pro 请求将以 V4.1-Flash 费率路由至 V4.1-Flash,直至 V4.1-Pro 发布
- KV 缓存大幅压缩:相比上代,仅需 1/4 的 HBM 和 1/8 的 SSD 存储。官方指出缓存命中费用常占 agent 成本大头,压缩缓存可显著降低成本
- 官方合作伙伴 WorkBuddyAI(含 Codebuddy)与 opencode 已完全支持 V4.1-Flash
所属事件:DeepSeek 发布 V4.1 Flash:552B MoE、百万上下文,V4 Pro 将退役(7 条相关)→
「Infra」频道最新
- DeepSeek 九个月将每 token KV 缓存体积压缩 54 倍 — zephyr_z9 · 2026-09-10
- vLLM 完整支持 DeepSeek-V4.1-Flash 新架构,含投机解码与 PD 分离 — vllm_project · 2026-09-10
- 评论者称其推理架构复杂到基础设施商难以复制,建议自建可抽成 10-20% — zephyr_z9 · 2026-09-10
- A19 Pro 四核算力 140 TOPS,A20 Pro 端侧推理或超 140 TFlops — AIFlow_ML · 2026-09-10
- KV 缓存比 V1 小 437 倍:V4.1 Flash 直击中国算力内存瓶颈 — ChrisGPT · 2026-09-10
- Aspen 研讨会探讨「公共算力」:数据中心如何服务社区而非对抗社区 — lfschiavo · 2026-09-10