专题 · FULL STORY
DeepSeek V4.1 Flash:上线、实测与降本新招
DeepSeek V4.1 Flash 在 Together AI 上线,号称性能超越 GPT-5.6 Sol 而成本仅为其三分之一;随后开源推理引擎 TensorSharp 作者实测其 GGUF 版本在 8×A40 上表现亮眼,DeepSeek 又发布 KV 缓存压缩方法,进一步压低推理内存成本。
2026-09-12 ~ 2026-09-13 · 3 集 · 7 条
第 1 集 · DeepSeek V4.1 Flash 上线 Together AI,性能超 GPT-5.6 Sol 成本仅三分之一(2026-09-12,3 条)
Together AI 宣布上线 DeepSeek V4.1 Flash。该模型为多模态 MoE 架构,采用 Causal Encoder-Decoder,由 552B 主干加 196B Engram 参数构成,支持 1M 上下文与 890B KV 缓存压缩。官方称其 agentic 基准成绩超过 GPT-5.6 Sol 与自家 V4 Pro,而每任务成本仅为 GPT-5.6 Sol 的三分之一。技术报告解读指出,其通过三层压缩以约三分之一参数量在 Artificial 基准上击败 1.6T 参数模型。
- DeepSeek V4.1 Flash 技术报告解读:三层压缩让 552B 打败 1.6T — 机器之心 · 2026-09-12
- DeepSeek V4.1 Flash 上线 Together AI,成本仅三分之一 — togethercompute · 2026-09-13
- DeepSeek V4.1 Flash 发布:890B KV 缓存压缩,agentic 成绩超 V4 Pro — togethercompute · 2026-09-13
第 2 集 · TensorSharp 实测 DeepSeek V4.1 Flash,八卡A40性能亮眼(2026-09-13,2 条)
开源推理引擎 TensorSharp 作者公布 DeepSeek V4.1 Flash GGUF 在 8×A40(layer split、F16 KV cache、65K 上下文)配置下的实测:解码速度约 40 tok/s。该引擎新增了 DeepSeek V4.1 Flash 专用执行路径,在 Q2K 量化下预填充可达 533–539 tok/s,突破 500 tok/s,显示消费级多卡部署新模型的可行性。
- DeepSeek V4.1 Flash 八卡 A40 实测:自研推理引擎跑到 40 tok/s — fuzhongkai · 2026-09-13
- TensorSharp 引擎实测:DeepSeek V4.1 Flash 在 8×A40 上预填充破 500 tok/s — fuzhongkai · 2026-09-13
第 3 集 · DeepSeek V4.1-Flash 将 KV 缓存压至每 token 890 字节(2026-09-13,2 条)
DeepSeek 随 V4.1-Flash 发布了一种大幅压缩 KV cache 内存占用的新方法,将每 token 的 KV cache 显存压缩到仅 890 字节,核心手段包括 CED 分离等技术。该模型主打长上下文效率,直接效果是可支持更大的上下文窗口,同时显著降低推理内存成本。有博主和 Reddit 用户对其架构进行了逐层拆解与分析。
- DeepSeek V4.1 Flash 把 KV Cache 压到每 token 890 字节 — Prompt Engineering · 2026-09-13
- DeepSeek 发布 V4.1-Flash KV 缓存压缩法,大幅降低推理内存成本 — justlikemedics · 2026-09-13