专题 · FULL STORY

DeepSeek V4.1 Flash:上线、实测与降本新招

DeepSeek V4.1 Flash 在 Together AI 上线,号称性能超越 GPT-5.6 Sol 而成本仅为其三分之一;随后开源推理引擎 TensorSharp 作者实测其 GGUF 版本在 8×A40 上表现亮眼,DeepSeek 又发布 KV 缓存压缩方法,进一步压低推理内存成本。

2026-09-12 ~ 2026-09-13 · 3 集 · 7 条

第 1 集 · DeepSeek V4.1 Flash 上线 Together AI,性能超 GPT-5.6 Sol 成本仅三分之一(2026-09-12,3 条)

Together AI 宣布上线 DeepSeek V4.1 Flash。该模型为多模态 MoE 架构,采用 Causal Encoder-Decoder,由 552B 主干加 196B Engram 参数构成,支持 1M 上下文与 890B KV 缓存压缩。官方称其 agentic 基准成绩超过 GPT-5.6 Sol 与自家 V4 Pro,而每任务成本仅为 GPT-5.6 Sol 的三分之一。技术报告解读指出,其通过三层压缩以约三分之一参数量在 Artificial 基准上击败 1.6T 参数模型。

第 2 集 · TensorSharp 实测 DeepSeek V4.1 Flash,八卡A40性能亮眼(2026-09-13,2 条)

开源推理引擎 TensorSharp 作者公布 DeepSeek V4.1 Flash GGUF 在 8×A40(layer split、F16 KV cache、65K 上下文)配置下的实测:解码速度约 40 tok/s。该引擎新增了 DeepSeek V4.1 Flash 专用执行路径,在 Q2K 量化下预填充可达 533–539 tok/s,突破 500 tok/s,显示消费级多卡部署新模型的可行性。

第 3 集 · DeepSeek V4.1-Flash 将 KV 缓存压至每 token 890 字节(2026-09-13,2 条)

DeepSeek 随 V4.1-Flash 发布了一种大幅压缩 KV cache 内存占用的新方法,将每 token 的 KV cache 显存压缩到仅 890 字节,核心手段包括 CED 分离等技术。该模型主打长上下文效率,直接效果是可支持更大的上下文窗口,同时显著降低推理内存成本。有博主和 Reddit 用户对其架构进行了逐层拆解与分析。