DeepSeek V4.1 Flash 架构重置:KV 缓存缩至 1/4

DeepSeek 发布 V4.1 Flash,在模型体量约为前代两倍的情况下,将工作 KV 缓存压缩到 1/4、持久缓存存储降到 1/8,实测速度接近 420 tokens/s。多位独立评论者认为这是「AI 工程与研究的杰作」,架构解析者甚至认为其含金量足以称为「DeepSeek-V5 Flash」。该模型通过主动删除自家旧设计实现架构重置,长 agent 会话的缓存持有成本显著下降,但社区对 190B+ engram 查找表的机制仍有困惑。

已确认

尚未确认

为什么重要

2026-09-15 ~ 2026-09-17 · 5 条相关

一手来源