专题 · FULL STORY

DeepSeek V4 Flash:低价开源引发实测热潮

DeepSeek V4 Flash 模型正式开源并发布,凭借极低的使用成本和比肩顶级闭源模型的性能引发社区实测热潮。该模型迅速登顶各大平台调用量榜首,在多项基准测试中展现出惊人的性价比。

2026-07-31 ~ 2026-08-08 · 6 集 · 168 条

第 1 集 · DeepSeek V4 Flash实测:低成本高性能引发社区热议(2026-07-31,33 条)

DeepSeek-V4-Flash-0731 发布后,凭借极低的使用成本和比肩顶级闭源模型的性能,在开发者社区引发大量实测。数据显示该模型智能指数达到 50 分,追平 Gemini 3.6 Flash,实际任务能力接近 Claude 3.5 Sonnet。在多项复杂任务实测中,它以极低的 token 消耗证明了开源模型在当前 AI 价格战中的绝对性价比优势。

已确认

  • 性能跑分:据 Artificial Analysis 测评数据,DeepSeek V4 Flash (0731) 取得 50 分,追平 Gemini 3.6 Flash,接近 2026 年 3 月创下的 51 分最高纪录。@bindureddy 指出其实际任务能力接近 Claude 3.5 Sonnet。
  • 成本碾压优势:@teortaxesTex 指出,虽然 GPT-5.6 Luna 输入价格低廉,但其输出 token 价格($1.20/M)远高于 DeepSeek($0.28/M)。@autooff 以每月 70 亿 token 估算,Luna 约需 250 美元,DeepSeek 仅为其三分之一。@zainhas 的对比数据表明,单任务成本 DeepSeek 为 $0.03,Luna 为 $0.07,便宜 2.3 倍。@Hesamation 也补充,即便 Luna (max) 经历 80% 降价,DeepSeek V4 Flash 依然几乎等同于免费。
  • 编程与 3D 任务:@cedricchee 在 Codex CLI 中测试 248B 参数的 DeepSeek-V4-Flash 生成 3D 体素宝塔花园,耗时 10 分钟仅花 0.07 美元;另一次 37 次 API 请求的测试耗时 17 分钟,消耗约 379 万 token,仅花费 0.04 美元。@Arindam1729 用其编写 3D 贪吃蛇游戏,3 次迭代完成,总成本不到 1 美元。@Teknium 也转发了单次复杂 Agent 任务耗时 32 分钟仅花 0.07 美元的测试。
  • 多模态与安全测试:@teortaxesTex 在同价位测试中,DeepSeek V4-Flash 在三项 Canvas 渲染测试中胜过 GPT-5.6 Luna。但在网络安全 CVE 基准测试中,DeepSeek Flash v4 找回 24/32 个 CVE(pass@3 召回率 75%),性价比仍逊于 Luna。
  • 推理速度:@benburtenshaw 报告该模型在推理端点可达 400 tokens/s 生成速度,租用成本仅 10 美元/小时。
  • 本地部署:多位开发者分享了本地运行经验。@AmbitiousFold2874 使用 4 张 5060 Ti (16GB) 搭配 DDR4 3200 内存,在 128k 上下文下运行;@LegacyRemaster 使用 RTX 6000 (96GB) 与 W7800 (48GB) 混合算力运行 Q3KXL 量化版;@Different-Pickle1021 在 A100 (40GB) 上使用 Q8KXL 量化(162GB)并将专家层卸载至 CPU,生成速度约 15.8GB 显存占用;@Nyghtbynger 在 200K 上下文中测试,模型保持连贯性;@xjdr 指出提示词格式和工具调用怪癖可能引发集成问题;@zephyrz9 在 M3 Ultra Mac Studio (512GB) 上达到 40 tok/s;@Fit-Produce420 在 AMD Strix Halo 上支持约 64K 上下文,速度约 35 tok/s;@akhaliq 转发使用 7 张 3090 运行 Q8 量化版。

尚未确认

  • 部分为开发者个人实测,未提供完整复现细节,结果可能因任务具体设定而异。
  • 关于 DeepSeek V4 Flash 与 Luna 的智能评分(50 vs 51)来自 @zainhas 与 @joorklee 的引用,但未说明具体评测方法。

为什么重要

DeepSeek V4 Flash 以极低的价格提供了接近甚至超越部分闭源模型的能力,大幅改变了 AI 服务的成本结构。在 OpenAI 等厂商发起降价战的背景下,该模型不仅对头部厂商构成了实质性的竞争压力,也为开发者提供了极具性价比的平替方案。

还有 13 条相关讨论 →

第 2 集 · DeepSeek V4-Flash 发布:Agent 能力跃升,开源且极致低价(2026-07-31,100 条)

7月31日,DeepSeek 正式发布 V4-Flash 模型 API 并同步在 Hugging Face 开源模型权重。本次更新未改变模型架构,主要通过重新后训练大幅提升了 Agent 能力,多项基准测试得分超越前代 V4-Pro-Preview,并以极具竞争力的定价提供比肩旗舰模型的性能,引发社区热议。

已确认

  • API与架构:DeepSeek-V4-Flash 正式版 API 已开放公测。模型采用 MoE 架构,支持100万 token 上下文,原生支持 OpenAI Responses API 格式,全面适配 Codex 并推出一键配置脚本。官方澄清本次升级仅限 V4-Flash API,V4-Pro API 及 App/Web 端保持不变,V4-Pro 正式版即将发布。
  • Agent能力跃升:官方确认 Agent 能力大幅提升,TerminalBench2.1 得分82.7(较4月预览版暴涨25.8分),Cybergym 76.7,Toolathlon 70.3,DeepSWE 54%。在 Artificial Analysis 智能指数中获得 50 分,较前代跃升 10 分,反超自家 V4-Pro 6 分,逼近 GPT-5.6 Luna 与 GLM-5.2。
  • 开源与生态:DeepSeek 在 Hugging Face 发布了 DeepSeek-V4-Flash-0731 权重,采用 MIT 协议,支持8-bit 与 fp8 精度。Hugging Face 工程师 Victor Mustar 部署了免费公共推理端点,无需 token 即可调用。编码工具 Cline 已率先集成该模型。
  • 极致性价比:该模型定价极具竞争力,输入价格仅 $0.11 每百万 token,输出价格 $0.27。据网友对比,其成本仅为 Kimi K3 的五十分之一或 Gemini 3.6 Flash 输出价格的三十分之一。

尚未确认

  • DeepSWE 编程榜单成绩目前主要由 DeepSeek 单方面宣称,发帖人强调尚未得到独立第三方完全验证。

为什么重要

  • V4-Flash 通过重新后训练实现 Agent 能力跨越式提升,为开发者提供更强大的任务执行与工具调用模型。其原生兼容 Codex、开源权重及极具竞争力的成本优势,进一步降低了智能体开发门槛,被部分观察者视为又一次“DeepSeek 时刻”。

还有 80 条相关讨论 →

第 3 集 · DeepSeek V4 系列引热议:Flash 性能暴涨与 Pro 规模之争(2026-07-31,3 条)

AI 社区近期热烈讨论 DeepSeek V4 系列。有观点推测 V4-Flash 性能大幅提升,可能得益于更强大的 V4-Pro 充当强化学习教师模型。同时,业界也在探讨模型规模与能力的关系,关注约 300B 参数的 V4-Pro 能否凭借更强的基座击败 2.8T 参数的新模型,以及评估饱和对模型进步的潜在限制。

第 4 集 · DeepSeek V4 Flash登顶OpenRouter,成本仅为竞品百分之一(2026-08-03,14 条)

DeepSeek V4 Flash(0731版本)正式上线后迅速登顶OpenRouter平台调用量榜首,单日Token消耗量据称超8万亿。多家独立评测机构的数据显示,该模型以远低于同档竞品的成本拿下了接近顶级的成绩,正在把大模型竞争的主轴从“单次智力比拼”推向“长任务性价比计算”。这被视为国产模型对全球闭源定价体系的一次正面冲击。

已确认

  • 基准成绩:据@teortaxesTex转述WeirdML评测,DeepSeek v4 Flash(0731)以57.1%和63.0%的成绩打破成本与准确率的SOTA纪录,超越近期刚降价的GPT 5.6 Luna;评测者同时指出分数略低于预期,但更看好其Agent潜力。
  • 成本对比:独立评测机构Artificial Analysis数据显示(经@SirBoboGargle转述),在复杂真实世界工作负载中,使用DeepSeek V4 Flash的成本仅约0.03美元,而Claude Fable 5高达3.15美元,约为后者的百分之一。@ImaginaryDinner2710也指出,其成本比Anthropic Opus 5便宜100倍。
  • Vals榜单:据@zephyrz9引用Vals Index的结果,DeepSeek V4 Flash(0731)是榜单上首个得分超过60的最低价模型,比下一个最优模型便宜约35倍,且这一成本优势几乎全部来自其代码能力。
  • 调用量与迁移:@APPSO、@创业邦等报道,该模型已登顶OpenRouter调用量榜首,单日Token消耗超8万亿;国产模型总调用规模连续多周超越美国闭源模型总和,大量海外开发者主动将生产环境迁移至该模型。
  • 价格具象化:据@量子位转述,运行一局3D射击游戏约7分钱、一局CS约5毛钱,且海外中间商仍在叠加补贴,甚至出现1美分级别的报价。@FuSheng0306测算重度用户一周成本约30元。
  • 降本实践:@PrajwalTomar指出,许多开发者习惯在所有任务上使用昂贵的旗舰模型导致账单高企,而廉价开源模型效果不佳;通过在现有工具链中接入成本仅为旗舰模型五十分之一的DeepSeek V4 Flash,可有效平衡成本与性能。

为什么重要

  • @FuSheng0306将该模型比作AI时代的福特T型车,强调其极限性能未必登顶,但“刚好够用且人人用得起”。V4 Flash用极低价格和出色的代码、Agent能力,为开发者提供了远更具经济效益的选择,定义了市场的“斩杀线”。当成本降到竞品的数十分之一,Agent时代“长任务、多轮调用”的经济模型被重新定义——这已不再只是性能竞赛,而是一场算账竞赛。

第 5 集 · DeepSeek-V4-Flash发布并全面登陆各大平台(2026-08-06,4 条)

DeepSeek发布最新开源权重模型DeepSeek-V4-Flash-0731,拥有304B参数,性能超越更大体积模型。该模型已全面上线Ollama云端及engy.ai等平台,输出速度超120 tps。其API定价极具竞争力,输入与输出成本比官方及同级模型低30%至68%,主打高效与前沿性能。

第 6 集 · DeepSeek-V4 Flash实测:成本仅Luna六分之一,性能达八成(2026-08-07,14 条)

开发者zainhas基于DeepSWE基准对DeepSeek-V4 Flash 0731与GPT-5.6 Luna进行了软件工程任务实测。核心结论是DeepSeek性价比极高:单任务成本仅$0.10,约为Luna($0.60)的1/6,准确率达Luna的80%(53.3% vs 67.2%)。通过并行多次尝试或与Luna级联的策略,DeepSeek可追平甚至超越Luna,同时大幅降低成本。该对比为开发者选择模型提供了重要参考,凸显了低成本模型在软件工程场景的潜力。

已确认

  • 成本与准确率:DeepSeek每任务$0.10,Luna为$0.60,相差约5-6倍;准确率DeepSeek 53.3%,Luna 67.2%,Luna仅高约14个百分点。DeepSeek端到端耗时23分钟。
  • 多次尝试效果:DeepSeek经济性允许并行多次尝试,2次尝试(pass@2)准确率81.6%(成本$0.20),4次达90.3%;Luna相应为70.1%和80.5%。
  • 级联策略:先用DeepSeek处理,验证失败时升级到Luna,准确率78.9%,成本$0.385,比Luna单模型(67.2%,$0.61)成本降37%(即Luna成本的63%),准确率提升11.7%。
  • 任务重叠:两者共同解决87个任务,Luna独解15个,DeepSeek独解仅4个,相关性0.50。
  • 领域表现:Luna在7/8个领域胜出,在程序分析(69-33)、并发(70-38)、运行时内部(86-59)等难题上领先约30分;DeepSeek仅在查询与配置(78-70)上占优。DeepSeek在JavaScript上表现崩溃(35-60),Python较弱(49-65),Rust(55-60)和Go(62-79)尚可。
  • 失败模式:DeepSeek回归破坏率9%,Luna为15%,DeepSeek失败更优雅,而价格更高的模型反而更需要回归测试来防护。

尚未确认

  • 具体测试环境、任务集细节及模型版本信息未在帖子中完整披露。

为什么重要

该实测为开发者提供了明确的成本-性能权衡依据:在预算敏感场景下,DeepSeek-V4 Flash凭借极低成本和可接受的准确率成为高性价比选择;而通过多次尝试或级联策略,可在不显著增加成本的情况下达到甚至超越顶级模型。这有助于推动大模型在软件工程领域的更广泛应用。