专题 · FULL STORY

DeepSeek V4-Flash:从泄露到本地部署热潮

DeepSeek V4-Flash模型信息意外泄露后开启API公测。凭借极高的性价比与百万上下文,该模型不仅引发社区本地部署热潮,更在多项基准测试中以极低成本碾压竞品。

2026-07-31 ~ 2026-08-11 · 15 集 · 88 条

第 1 集 · DeepSeek-V4-Flash架构曝光:主打百万上下文(2026-07-31,3 条)

Hugging Face与vLLM Recipes页面意外泄露了DeepSeek-V4-Flash模型的详细信息,引发AI社区热议。泄露数据显示,该模型总参数量达284B,激活参数仅为13B,采用FP4混合精度,并原生支持百万级Token上下文。作为V4预览家族的新成员,其主打百万上下文智能,展现了DeepSeek在大模型效能与长文本处理上的最新探索。

第 2 集 · Unsloth发布DeepSeek V4 Flash 0731量化版,支持本地部署(2026-07-31,6 条)

Unsloth于7月31日至8月2日发布了DeepSeek V4 Flash 0731的GGUF动态量化版本,使该模型能够在本地硬件上运行。模型基于deepseekv4架构,采用MIT开源协议。此次发布大幅降低了本地部署门槛,引发了社区对量化精度与性能权衡的讨论。

已确认

  • Unsloth在Hugging Face发布了DeepSeek-V4-Flash-0731的量化版本,包含从83GB到162GB不等的多个动态量化(UD)选项。
  • 162GB的UD-Q8KXL版本可实现完全无损,最低83GB的IQ1S版本仍能保留73%的性能,97GB版本也是可用的选项之一。
  • 用户可通过Unsloth或llama.cpp运行该模型。硬件需求方面,无损4-bit量化需168GB内存,3-bit量化需110GB内存。

尚未确认

  • 针对社区对量化命名与精度差异的疑问,开发者danielhanchen进行了说明,但具体细节与澄清结论尚未在材料中完整呈现。

为什么重要

  • 此次发布使DeepSeek V4 Flash 0731能够在消费级硬件上实现本地部署,为不同显存环境的开发者提供了灵活的方案,对AI开发者和研究者具有重要意义。

第 3 集 · DeepSeek配华为芯推理利润率反超OpenAI(2026-08-01,2 条)

观点指出,DeepSeek 在 V4 Flash 模型上使用华为昇腾芯片,其推理利润率反超使用英伟达 Blackwell 芯片的 OpenAI。尽管 OpenAI 的 Luna 模型规模更大,但 DeepSeek 凭借业界领先的 KV cache offload 系统与顶尖的底层算子工程能力,实现了极致的优化,从而获得了更高的利润率表现。

第 4 集 · DeepSeek-V4-Flash前端编码惊艳,性价比远超同档模型(2026-08-01,3 条)

DeepSeek新发布的DeepSeek-V4-Flash-High模型在前端代码竞技场中取得1586分,位列总榜第七、开源模型第三。该模型以极低的推理成本(单次测试约6美分,仅为同档模型的3%)重塑了性价比帕累托前沿,其卓越表现甚至让测试者怀疑是否选错了模型,展现出强大的市场竞争力。

第 5 集 · DeepSeek V4前瞻:Flash引入四级推理强度(2026-08-01,2 条)

代码库信息与开发者讨论揭示了 DeepSeek V4 模型的多项前瞻特性。据悉,当前曝光的测试版实质上是 V4-Flash 预览,该系列模型将在推理强度上进行重大调整,预计提供 nothink、low、high 等四个不同级别的思考模式。此外,下一代 DeepSeek 模型还有望整合视觉能力。

第 6 集 · DeepSeek历代模型训练算力成本大幅下降(2026-08-01,2 条)

DeepSeek 在模型训练算力优化上取得显著成效,其历代版本每训练 1T tokens 的 GPU 消耗量呈现大幅下降趋势。数据显示,从 V1 版本需要 30 万 H800 GPU 时,降至 V2 的 17.3 万与 V3 的 18 万。而最新的 V4-Flash 模型更是将算力开销暴降至 6.6 万 GPU 时,极致摊薄了 MoE 架构的计算成本。

第 7 集 · DeepSeek V4-Flash API公测,Agent能力大幅提升(2026-08-01,5 条)

DeepSeek 官方宣布 V4-Flash API 正式开启公测,新模型在 Agent 能力与各项基准测试中取得大幅提升,部分跑分已超越前代 V4-Pro-Preview 版本,引发社区广泛关注。

已确认

  • 模型架构与规格:DeepSeek V4-Flash 采用 284B 参数的 MoE 架构,激活参数为 13B,支持 100 万 tokens 上下文,并原生兼容 Codex。
  • Agent 能力升级:官方表示新版本针对智能体编码和工具调用能力进行了大规模升级。
  • Terminal-Bench 成绩:该模型在 Terminal-Bench 评测中得分达到 82.7 分,相比 4 月份预览版的 56.9 分实现了 25.8 分的飞跃。
  • 前端代码竞技场:DeepSeek V4 Flash High 在前端代码竞技场冲至总榜第 7 名(得分 1586),在开源模型中位列第 3。其细分领域表现包括消费产品类第 4,参考设计、数据分析和游戏等类目也位居前列。

尚未确认

  • 据 @teortaxesTex 引用的爆料数据,DeepSeek V4 Flash 跑分较前代预览版翻了一倍以上,且 V4 Pro Preview 同样取得了大幅跨越,具体完整跑分细节仍有待更多官方基准测试验证。

为什么重要

  • V4-Flash 在保持开源属性的同时,大幅提升了智能体(Agent)的执行与工具调用能力,这意味着 DeepSeek 在实用型编码 AI 的竞争中迈出了关键一步,为开发者提供了更强大的开源替代方案。

第 8 集 · DeepSeek V4-Flash成本低105倍引热议,稳定性与基准过拟合存疑(2026-08-01,17 条)

DeepSeek V4-Flash-0731 模型近期在多项基准测试中展现出极高的性价比,据 Artificial Analysis 实测,其完成相同任务的整体成本比竞品 Fable 5 低 105 倍。这一数据促使业界呼吁将关注点从传统的单 token 价格转向单次任务成本。尽管跑分亮眼,但该模型在实际应用中的 API 稳定性、综合能力以及计费方式的合理性仍存在争议,且对测试框架极为敏感。

已确认

  • 在 Terminal-Bench 2.1 评测中,DeepSeek V4-Flash 得分为 82.7 分,与 Fable 5 的 80.5 分表现近乎一致。
  • 据 Artificial Analysis 实测报告,DeepSeek 完成相同基准任务的整体成本比 Fable 5 低 105 倍。@zainhas 与 @mustafamhus 均确认了这一成本差距。
  • 该模型输出定价为 $0.28/M,恰好与 OpenAI 降价 80% 后(叠加 OpenRouter 促销至 $0.60/M)的 GPT-5.6 Luna 落入同一价格区间。
  • LM Studio 已上线该模型,支持本地运行或云端使用,并在代码库学习和修改任务中展现出极具成本效益的优势。
  • 模型目前提供 Low、High 和 Max 三档努力等级(没有 Medium)。@teortaxesTex 指出,DeepSeek 需要开启到 Max 级别才能与 Grok 4.5 的 M 级表现持平。

尚未确认

  • API 稳定性与实际总成本:开发者 @kmsdev 在 34 个提示词的测试中发现,该模型在 OpenRouter 上的供应商表现不稳定,多次生成失败,且最终花费 1.29 美元,在性能与成本上均不敌 Kimi K3。
  • 单 token 定价的误导性:@cephaloform 与投资人 Chamath 等人指出,尽管 DeepSeek 每 token 价格极低,但如果模型需要更多轮次才能完成任务,其实际总成本反而可能更高。
  • 测试框架的极度敏感:@PMinervini 与 @teortaxesTex 发现,DeepSeek V4 Flash 对测试框架非常敏感。如果使用了不匹配的工具链(如 Pi、Claude Code 等),模型表现会大打折扣甚至疯狂消耗上百万 Token;但在正确的框架下,则展现出接近 GPT 级的性价比。
  • 基准测试过拟合争议:@rickasaurus 认为当前大模型基准测试存在严重过拟合问题,并指出 5 个月前 GPT-4o 在 Artificial Analysis 智能指数最高分为 51,而本周 DeepSeek V4-Flash 在同一榜单拿下了 51 分,跑分图表已失去参考价值。

为什么重要

  • 评价体系的转变:@mustafamhus 与 @AravSrinivas 均指出,这种两个数量级的成本下降极其罕见,堪称 DeepSeek 的“2.0 时刻”。这要求企业决策者和开发者跳出传统的单 token 定价思维,开始真正关注“单次任务成本”。@intellectronica 更是称其为便宜到无法计量的时刻。@svenai 也补充称,DeepSeek 以 3 美分成本达到了约 50 分的智能水平,凸显极致性价比。
  • 开源模型横向对比:在具体的游戏生成等任务实测中(@mustafamhus),DeepSeek V4-Flash 虽然成本极低,但在得分上依然落后于 Kimi K3(9.5/10,花费 $0.0740)和 GLM 5.2(9/10,花费 $0.0480),表明单纯追求成本下降并不能完全替代模型间的综合能力竞争。

第 9 集 · DeepSeek V4 Flash 本地部署潮(2026-08-01,26 条)

DeepSeek-V4-Flash-0731 发布后,社区迅速在 NVIDIA、AMD、Mac 和 DGX Spark 上做本地实测。结论是:它已能在个人硬件上跑起来,但速度差异极大,量化、后端、投机解码与内存带宽往往比“显卡型号”更决定体验。

已确认

  • NVIDIA 侧从单张 RTX 3090 到专业卡、多卡都已跑通:未优化 3090 只有 4.02 tok/s,OkNinja7526 的 3090 24GB + 128GB DDR5 可到 12.5 tok/s,RTX A6000 + 256GB DDR4 跑 Q8 约 17.2 tok/s;3×3090 跑 UD-Q3KXL 占用 119GB,RTX PRO 6000 Max-Q eGPU 为 44-59.5 tok/s,2× RTX PRO 6000 Blackwell 用 DSpark 投机解码测到 243 tok/s 中位数。
  • 优化和平台差异同样显著。HockeyDadNinja 只重算 129 个路由专家张量到 IQ3XXS,称混合多 GPU 解码提速 40%;fragmentme 用 5 张消费级卡全显存加载后,Prompt 处理仍只有约 600 t/s。AMD 方案里 3×MI50 达 15 tok/s、7900 XTX + 3×MI60 达 11 tok/s;Mac 侧 M1 Ultra 128GB 打补丁后从 5-6 tok/s 升至 15-16 tok/s,512GB M3 Ultra 跑 mxfp4 约 37 tok/s。DGX Spark 上,3bit 版为 16.5 tok/s,2-bit 版可装下 155GB 模型。

尚未确认

  • MiaAI 经 pbaylies 转发称,单台 DGX Spark 在 agentic 工作流里 12 并发聚合吞吐量可到 58.5 tok/s 并超过双卡 vLLM;Lucebox 也宣称其与 AMD 的异构消费级方案在完整 284B 模型上做到 51.1 tok/s。两者都缺少当前簇内的独立复现。

为什么重要

这波实测说明,前沿 MoE 模型的本地部署门槛正在下降,但“能跑”不等于“好用”,Prompt 吞吐、统一内存或系统内存带宽和软件栈优化仍是关键。

还有 6 条相关讨论 →

第 10 集 · DeepSeek V4 Flash 量化实测:低精度版本大幅提速且无损质量(2026-08-04,2 条)

近期有开发者在双 RTX 5090/6000 Pro Blackwell 及 128GB 显存硬件环境下,对 DeepSeek V4 Flash 的 Unsloth Q8 与 Q3 xxs(IQ3XXS)量化版本进行了详细基准测试。结果显示,低精度的 Q3 版本运行速度比 Q8 快出数倍,且能实现翻倍提速,同时保持模型质量基本无损。

第 11 集 · 单卡RTX 5090成功跑满DeepSeek百万上下文(2026-08-04,2 条)

有开发者成功在单张RTX 5090(32GB显存)搭配256GB DDR5内存的桌面环境下,部署了DeepSeek-V4-Flash模型并跑满100万原生上下文。最新优化进展显示,通过采用双CUDA图技术,有效解决了此前固定批处理带来的性能瓶颈,进一步提升了该庞大模型在消费级硬件上的推理速度。

第 12 集 · DeepSeek-V4-Flash 登顶性价比前沿,运行成本远低竞品(2026-08-05,4 条)

最新推出的 DeepSeek-V4-Flash 模型在成本效益上实现突破。研究显示其基准测试平均成本仅 3 美分,远低于 Kimi K3 及欧美大模型。实测中完成数小时复杂任务仅花 0.31 美元。该模型在 Agent Arena 排行榜中位列第 21 名,凭借极高的性价比受到开发者青睐。

第 13 集 · DeepSeek V4 Flash跑分曝光,性能反超Pro版(2026-08-05,3 条)

DeepSeek V4 Flash 0731的本地跑分和基准测试成绩曝光。在Terminal-Bench 2.1中取得82.7分,参数仅为Pro版五分之一却反超。Unsloth AI通过DSpark工具将其GGUF量化版本本地推理速度提升至120 tokens/s,提速1.4至2倍且不损精度。

第 14 集 · DeepSeek V4 Flash登顶ARC-AGI性价比,成本仅GPT-5.6四分之一(2026-08-08,9 条)

DeepSeek V4 Flash在ARC-AGI基准测试中表现惊艳,以极低的推理成本重新定义了模型性能与成本的帕累托前沿。据ARC Prize官方验证,该模型在半私有任务中取得顶尖成绩,成本仅为GPT-5.6的四分之一,打破了性能提升必然伴随成本增加的行业惯例,引发业界对Agent落地成本和推理机制的重新思考。

已确认

  • ARC Prize官方验证数据:DeepSeek V4 Flash在ARC-AGI-2半私有任务中得分61.4%,单任务成本0.04美元;在ARC-AGI-1半私有任务中得分89.0%,单任务成本0.02美元(@petrusenkomax、@GregKamradt均引用)。
  • 成本对比优势:@GregKamradt指出其成本仅为GPT-5.6的四分之一;@togethercompute在DeepSWE基准测试中发现,在相同预算下,DeepSeek V4 Flash的成本约为GPT-5.6的三分之一,且能解决更多任务。
  • 成本曲线反直觉现象:开发者@DeArgonaut实测DeepSeek V4 (0731)证实,模型在获得更高分数的同时,单任务推理成本反而显著下降。@GregKamradt引用官方技术分析解释了这一现象,指出处于最高推理模式的模型实际上比高推理模式更省钱,因为推理Token越多模型反而越容易跑偏。
  • 解决Agent成本难题:@Teknium与@MaziyarPanahi均认为,该模型极具破坏力的性价比将打破运行AI智能体的资金瓶颈。@MaziyarPanahi补充指出,在实际临床交接工作流测试中,该模型运行速度优异且大规模应用成本可控。

尚未确认

  • 具体测试环境、硬件配置及推理成本的详细计算方式尚未完全披露。

为什么重要

  • DeepSeek V4 Flash以极低成本达到顶尖推理性能,可能推动AI推理成本大幅下降,深刻影响开发者的模型选型和行业的定价策略。其“性能越高成本越低”的反直觉现象,也为大模型推理成本曲线的研究提供了新视角。

第 15 集 · 实测双机集群运行 DeepSeek V4 Flash 完美通过 22 项编码测试(2026-08-10,2 条)

最新硬件评测显示,在双机 NVIDIA DGX Spark 集群上本地运行的 DeepSeek V4 Flash 0731 模型表现优异,成为唯一通过全部 22 项认证编码基准测试的本地模型。结合最新的 NVFP4 支持,该模型不仅展现出媲美顶级托管模型的性能,还实现了极高的性价比,被视为推动基于 GB10 芯片系统销售的“杀手级应用”。