专题 · FULL STORY

DeepSeek V4 Flash发布及爆火历程

DeepSeek于8月4日推出V4 Flash公测版,凭借大幅提升的Agent能力和极低的推理成本引发业界轰动。随后该模型迅速获得开发者青睐,登顶Ollama平台增速榜首。

2026-08-04 ~ 2026-08-06 · 2 集 · 11 条

第 1 集 · DeepSeek V4 Flash公测上线,低成本Agent能力引关注(2026-08-04,9 条)

DeepSeek于8月4日推出V4 Flash API公测版,主打大幅提升的Agent能力、工具调用与长任务处理表现,并以极低的推理成本引发业界关注。该模型已陆续上线Together AI与CoreWeave等平台,凭借出色的性价比进一步推动了市场推理定价的下降。

已确认

  • 模型具体规格为总参数量284B,单token激活13B,支持1M token上下文窗口,并采用混合注意力机制。
  • 在基于1.25万次真实Agent会话的Agent Arena测试中,DeepSeek-V4-Flash在开源模型中排名第三。
  • 该模型原生支持Responses API格式与Codex适配,在终端、代码仓库和全栈任务中的编码能力得到显著增强。
  • Together AI平台已上线该模型,并支持可调推理(low / high / max)模式。
  • W&B官方确认,DeepSeek-V4-Flash-0731也已正式在CoreWeave的无服务器推理平台上线。开发者@ScottCondron实测后反馈,该模型在数据提取等任务上表现出色,兼顾了处理速度与低成本。

尚未确认

  • 关于“价格仅为竞品的1/57”的说法来自Together AI的发布公告,具体对比基准未详细说明。
  • 开发者@orange转述的“十余亿token胜过大几十亿GPT”等具体对比数据,因原始帖子未提供完整上下文,暂无法核实。

为什么重要

  • DeepSeek V4 Flash提供了前沿级的agent能力,同时大幅压低了推理成本(据称价格仅为竞品的1/57)。
  • 据@teortaxesTex分析,该模型带来的Disk KV cache是一项杀手级特性,这种架构突破看似会对其他大模型厂商构成威胁,但由于DeepSeek采取完全开源策略,实际上对整个开源生态是巨大利好。
  • @infwinston与@intellectronica均认为,这不仅为开发者提供了极具性价比的选择,更形成了一股强大的市场力量,有效推动了全行业AI推理定价的下降。

第 2 集 · DeepSeek-V4-Flash 登顶 Ollama 增速榜首(2026-08-05,2 条)

DeepSeek-V4-Flash 成为 Ollama 平台上 token 使用量增长最快的模型。该模型采用 284B 总参数与 13B 激活参数的混合专家架构,支持高达 100 万 tokens 的上下文,并提供 100tps 以上的高推理性能与零数据留存承诺。其强大的规格与跑分数据引发了社区的广泛关注。