专题 · FULL STORY
DeepSeek V4 Flash:低价开源引发实测热潮
DeepSeek V4 Flash 模型正式开源并发布,凭借极低的使用成本和比肩顶级闭源模型的性能引发社区实测热潮。该模型迅速登顶各大平台调用量榜首,在多项基准测试中展现出惊人的性价比。
2026-07-31 ~ 2026-08-08 · 6 集 · 168 条
第 1 集 · DeepSeek V4 Flash实测:低成本高性能引发社区热议(2026-07-31,33 条)
DeepSeek-V4-Flash-0731 发布后,凭借极低的使用成本和比肩顶级闭源模型的性能,在开发者社区引发大量实测。数据显示该模型智能指数达到 50 分,追平 Gemini 3.6 Flash,实际任务能力接近 Claude 3.5 Sonnet。在多项复杂任务实测中,它以极低的 token 消耗证明了开源模型在当前 AI 价格战中的绝对性价比优势。
已确认
- 性能跑分:据 Artificial Analysis 测评数据,DeepSeek V4 Flash (0731) 取得 50 分,追平 Gemini 3.6 Flash,接近 2026 年 3 月创下的 51 分最高纪录。@bindureddy 指出其实际任务能力接近 Claude 3.5 Sonnet。
- 成本碾压优势:@teortaxesTex 指出,虽然 GPT-5.6 Luna 输入价格低廉,但其输出 token 价格($1.20/M)远高于 DeepSeek($0.28/M)。@autooff 以每月 70 亿 token 估算,Luna 约需 250 美元,DeepSeek 仅为其三分之一。@zainhas 的对比数据表明,单任务成本 DeepSeek 为 $0.03,Luna 为 $0.07,便宜 2.3 倍。@Hesamation 也补充,即便 Luna (max) 经历 80% 降价,DeepSeek V4 Flash 依然几乎等同于免费。
- 编程与 3D 任务:@cedricchee 在 Codex CLI 中测试 248B 参数的 DeepSeek-V4-Flash 生成 3D 体素宝塔花园,耗时 10 分钟仅花 0.07 美元;另一次 37 次 API 请求的测试耗时 17 分钟,消耗约 379 万 token,仅花费 0.04 美元。@Arindam1729 用其编写 3D 贪吃蛇游戏,3 次迭代完成,总成本不到 1 美元。@Teknium 也转发了单次复杂 Agent 任务耗时 32 分钟仅花 0.07 美元的测试。
- 多模态与安全测试:@teortaxesTex 在同价位测试中,DeepSeek V4-Flash 在三项 Canvas 渲染测试中胜过 GPT-5.6 Luna。但在网络安全 CVE 基准测试中,DeepSeek Flash v4 找回 24/32 个 CVE(pass@3 召回率 75%),性价比仍逊于 Luna。
- 推理速度:@benburtenshaw 报告该模型在推理端点可达 400 tokens/s 生成速度,租用成本仅 10 美元/小时。
- 本地部署:多位开发者分享了本地运行经验。@AmbitiousFold2874 使用 4 张 5060 Ti (16GB) 搭配 DDR4 3200 内存,在 128k 上下文下运行;@LegacyRemaster 使用 RTX 6000 (96GB) 与 W7800 (48GB) 混合算力运行 Q3KXL 量化版;@Different-Pickle1021 在 A100 (40GB) 上使用 Q8KXL 量化(162GB)并将专家层卸载至 CPU,生成速度约 15.8GB 显存占用;@Nyghtbynger 在 200K 上下文中测试,模型保持连贯性;@xjdr 指出提示词格式和工具调用怪癖可能引发集成问题;@zephyrz9 在 M3 Ultra Mac Studio (512GB) 上达到 40 tok/s;@Fit-Produce420 在 AMD Strix Halo 上支持约 64K 上下文,速度约 35 tok/s;@akhaliq 转发使用 7 张 3090 运行 Q8 量化版。
尚未确认
- 部分为开发者个人实测,未提供完整复现细节,结果可能因任务具体设定而异。
- 关于 DeepSeek V4 Flash 与 Luna 的智能评分(50 vs 51)来自 @zainhas 与 @joorklee 的引用,但未说明具体评测方法。
为什么重要
DeepSeek V4 Flash 以极低的价格提供了接近甚至超越部分闭源模型的能力,大幅改变了 AI 服务的成本结构。在 OpenAI 等厂商发起降价战的背景下,该模型不仅对头部厂商构成了实质性的竞争压力,也为开发者提供了极具性价比的平替方案。
- DeepSeek Flash 价格极低且能力不俗 — bindureddy · 2026-07-31
- Luna 输入虽廉,长文本智能体任务仍难撼 DeepSeek 缓存经济 — teortaxesTex · 2026-07-31
- DeepSeek-V4-Flash 被移植至 AMD Strix Halo 运行 — Fit-Produce420 · 2026-07-31
- DeepSeek-V4-Flash 接入 Codex:成本仅为 Opus 的近 90 分之一 — teortaxesTex · 2026-07-31
- 同价位大模型实测:DeepSeek V4-Flash 多模态胜过 GPT-5.6 Luna — teortaxesTex · 2026-07-31
- 实测 DeepSeek-V4-Flash 智能体:3D 任务成本仅 0.07 美元 — cedric_chee · 2026-07-31
- 实测 DeepSeek-V4-Flash:Codex CLI 3D 任务成本仅 0.07 美元 — cedric_chee · 2026-07-31
- DeepSeek 编程成本仅 GPT Luna 三分之一:实测算力与 Token 消耗账本 — auto_off · 2026-07-31
- 实测 DeepSeek-V4-Flash:Codex CLI 跑 37 次 API 仅花 0.04 美元 — cedric_chee · 2026-07-31
- Deepseek V4 Flash 编码实测:性能介于 Opus 4.8 与 5 之间 — corruptbytes · 2026-07-31
- DeepSeek-V4-Flash 推理实测:400 tps 速度仅需 10 美元/时 — ben_burtenshaw · 2026-07-31
- 实测 DeepSeek V4 Flash 写 3D 游戏:3 次迭代搞定,成本不足 1 美元 — Arindam_1729 · 2026-07-31
- 7张3090极限压榨:成功跑通DeepSeek-V4量化版 — _akhaliq · 2026-08-01
- DeepSeek v4 flash 实测:能力出色但集成易踩坑 — _xjdr · 2026-08-01
- DeepSeek 新模型实测:长上下文表现佳,工具调用易踩坑 — TheZachMueller · 2026-08-01
- 实测 DeepSeek V4 Flash:20万上下文不掉链,推理能力惊艳 — Nyghtbynger · 2026-08-01
- DeepSeek-V4-Flash 量化版 A100 实测:仅占 15.8GB 显存 — Different-Pickle1021 · 2026-08-01
- DeepSeek Flash v4网安实测:找回24个CVE,性价比仍逊于Luna — teortaxesTex · 2026-08-01
- DeepSeek V4 Flash 性价比碾压:成本仅为 GPT-5.6 Luna 的 43% — zainhas · 2026-08-01
- DeepSeek V4 Flash 免费级别,Luna Max 大降价性价比惊人 — Hesamation · 2026-08-01
第 2 集 · DeepSeek V4-Flash 发布:Agent 能力跃升,开源且极致低价(2026-07-31,100 条)
7月31日,DeepSeek 正式发布 V4-Flash 模型 API 并同步在 Hugging Face 开源模型权重。本次更新未改变模型架构,主要通过重新后训练大幅提升了 Agent 能力,多项基准测试得分超越前代 V4-Pro-Preview,并以极具竞争力的定价提供比肩旗舰模型的性能,引发社区热议。
已确认
- API与架构:DeepSeek-V4-Flash 正式版 API 已开放公测。模型采用 MoE 架构,支持100万 token 上下文,原生支持 OpenAI Responses API 格式,全面适配 Codex 并推出一键配置脚本。官方澄清本次升级仅限 V4-Flash API,V4-Pro API 及 App/Web 端保持不变,V4-Pro 正式版即将发布。
- Agent能力跃升:官方确认 Agent 能力大幅提升,TerminalBench2.1 得分82.7(较4月预览版暴涨25.8分),Cybergym 76.7,Toolathlon 70.3,DeepSWE 54%。在 Artificial Analysis 智能指数中获得 50 分,较前代跃升 10 分,反超自家 V4-Pro 6 分,逼近 GPT-5.6 Luna 与 GLM-5.2。
- 开源与生态:DeepSeek 在 Hugging Face 发布了 DeepSeek-V4-Flash-0731 权重,采用 MIT 协议,支持8-bit 与 fp8 精度。Hugging Face 工程师 Victor Mustar 部署了免费公共推理端点,无需 token 即可调用。编码工具 Cline 已率先集成该模型。
- 极致性价比:该模型定价极具竞争力,输入价格仅 $0.11 每百万 token,输出价格 $0.27。据网友对比,其成本仅为 Kimi K3 的五十分之一或 Gemini 3.6 Flash 输出价格的三十分之一。
尚未确认
- DeepSWE 编程榜单成绩目前主要由 DeepSeek 单方面宣称,发帖人强调尚未得到独立第三方完全验证。
为什么重要
- V4-Flash 通过重新后训练实现 Agent 能力跨越式提升,为开发者提供更强大的任务执行与工具调用模型。其原生兼容 Codex、开源权重及极具竞争力的成本优势,进一步降低了智能体开发门槛,被部分观察者视为又一次“DeepSeek 时刻”。
- DeepSeek-V4-Flash 正式版上线,Agent 跑分远超预览版 — 赛博禅心 · 2026-07-31
- DeepSeek-V4-Flash 更新,V4-Pro 即将正式发布 — Nunki08 · 2026-07-31
- DeepSeek-V4-Flash 正式版 API 上线,Agent 能力大幅跃升 — APPSO · 2026-07-31
- DeepSeek-V4-Flash 更新,内部测试成绩大幅提升 — cedric_chee · 2026-07-31
- DeepSeek V4 Flash 模型已上线官方 API — ElMess-Siah · 2026-07-31
- DeepSeek V4 Flash 正式版发布,Agent 能力超越 V4 Pro 预览版 — 歸藏的AI工具箱 · 2026-07-31
- DeepSeek V4 Flash 正式版发布:Agent能力大幅提升 — op7418 · 2026-07-31
- DeepSeek V4 Flash 在 DeepSWE 基准测试中得分 54% — zainhas · 2026-07-31
- DeepSeek-V4-Flash 正式版 API 上线,Agent 能力大幅增强 — zainhas · 2026-07-31
- DeepSeek V4 Flash 正式版发布:Agent 能力大增,成本优势明显 — 数字生命卡兹克 · 2026-07-31
- DeepSeek-V4-Flash 正式版发布,Agent 能力大幅跃升 — jiqizhixin · 2026-07-31
- DeepSeek 澄清 V4-Flash 升级细节,V4-Pro 仍待发布 — deepseek_ai · 2026-07-31
- DeepSeek V4-Flash 原生支持 Codex,附一键配置教程 — zephyr_z9 · 2026-07-31
- DeepSeek 悄然上线 V4-Flash API,预计将开放权重 — Hot_Example_4456 · 2026-07-31
- DeepSeek-V4-Flash正式版实测:速度极速,效果竟超 Pro — vista8 · 2026-07-31
- DeepSeek V4-Flash Agent 测试超 Pro 版,一键适配 Codex — 卡尔的AI沃茨 · 2026-07-31
- DeepSeek 发布 V4-Flash-0731 新模型 — deepseek-ai · 2026-07-31
- DeepSeek V4-Flash 正式版跑分出炉,智能指数达 50 分 — MagicZhang · 2026-07-31
- DeepSeek-V4-Flash 正式版 API 上线,Agent 能力跃升且价格击穿底线 — 智东西 · 2026-07-31
- DeepSeek V4-Flash 跑分达 50,单次推理成本仅 0.2 美元 — xeophon · 2026-07-31
第 3 集 · DeepSeek V4 系列引热议:Flash 性能暴涨与 Pro 规模之争(2026-07-31,3 条)
AI 社区近期热烈讨论 DeepSeek V4 系列。有观点推测 V4-Flash 性能大幅提升,可能得益于更强大的 V4-Pro 充当强化学习教师模型。同时,业界也在探讨模型规模与能力的关系,关注约 300B 参数的 V4-Pro 能否凭借更强的基座击败 2.8T 参数的新模型,以及评估饱和对模型进步的潜在限制。
- DeepSeek V4-Flash 性能暴涨,或因 V4-Pro 充当 RL 教师 — teortaxesTex · 2026-07-31
- 行业探讨:300B 参数的 V4 Pro 能否击败 2.8T 新模型 — scaling01 · 2026-08-01
- V4-Pro 能力提升引热议:基础模型更强,但评估饱和或限制进步 — teortaxesTex · 2026-08-01
第 4 集 · DeepSeek V4 Flash登顶OpenRouter,成本仅为竞品百分之一(2026-08-03,14 条)
DeepSeek V4 Flash(0731版本)正式上线后迅速登顶OpenRouter平台调用量榜首,单日Token消耗量据称超8万亿。多家独立评测机构的数据显示,该模型以远低于同档竞品的成本拿下了接近顶级的成绩,正在把大模型竞争的主轴从“单次智力比拼”推向“长任务性价比计算”。这被视为国产模型对全球闭源定价体系的一次正面冲击。
已确认
- 基准成绩:据@teortaxesTex转述WeirdML评测,DeepSeek v4 Flash(0731)以57.1%和63.0%的成绩打破成本与准确率的SOTA纪录,超越近期刚降价的GPT 5.6 Luna;评测者同时指出分数略低于预期,但更看好其Agent潜力。
- 成本对比:独立评测机构Artificial Analysis数据显示(经@SirBoboGargle转述),在复杂真实世界工作负载中,使用DeepSeek V4 Flash的成本仅约0.03美元,而Claude Fable 5高达3.15美元,约为后者的百分之一。@ImaginaryDinner2710也指出,其成本比Anthropic Opus 5便宜100倍。
- Vals榜单:据@zephyrz9引用Vals Index的结果,DeepSeek V4 Flash(0731)是榜单上首个得分超过60的最低价模型,比下一个最优模型便宜约35倍,且这一成本优势几乎全部来自其代码能力。
- 调用量与迁移:@APPSO、@创业邦等报道,该模型已登顶OpenRouter调用量榜首,单日Token消耗超8万亿;国产模型总调用规模连续多周超越美国闭源模型总和,大量海外开发者主动将生产环境迁移至该模型。
- 价格具象化:据@量子位转述,运行一局3D射击游戏约7分钱、一局CS约5毛钱,且海外中间商仍在叠加补贴,甚至出现1美分级别的报价。@FuSheng0306测算重度用户一周成本约30元。
- 降本实践:@PrajwalTomar指出,许多开发者习惯在所有任务上使用昂贵的旗舰模型导致账单高企,而廉价开源模型效果不佳;通过在现有工具链中接入成本仅为旗舰模型五十分之一的DeepSeek V4 Flash,可有效平衡成本与性能。
为什么重要
- @FuSheng0306将该模型比作AI时代的福特T型车,强调其极限性能未必登顶,但“刚好够用且人人用得起”。V4 Flash用极低价格和出色的代码、Agent能力,为开发者提供了远更具经济效益的选择,定义了市场的“斩杀线”。当成本降到竞品的数十分之一,Agent时代“长任务、多轮调用”的经济模型被重新定义——这已不再只是性能竞赛,而是一场算账竞赛。
- 单日烧8万亿Token,DeepSeek凭极致性价比重塑Agent时代模型定价 — APPSO · 2026-08-03
- DeepSeek-V4-Flash 登顶 OpenRouter,极致性价比重塑大模型定价战 — 创业邦 · 2026-08-03
- DeepSeek v4 Flash登顶性价比,Agent潜力被看好 — teortaxesTex · 2026-08-03
- DeepSeek V4 Flash 以 35 倍低成本登上 Vals 高分榜 — zephyr_z9 · 2026-08-04
- DeepSeek V4-Flash 价格低到一局游戏只要几分钱 — 量子位 · 2026-08-04
- DeepSeek V4 成本仅为 Claude 1%:中国 AI 模型掀起价格战 — SirBoboGargle · 2026-08-04
- 别再全用Opus了:DeepSeek V4 Flash降本实践 — PrajwalTomar_ · 2026-08-04
- DeepSeek 被比作 AI 时代的福特 T 型车 — FuSheng_0306 · 2026-08-04
- DeepSeek V4 Flash 成本仅顶级模型百分之一,将引爆自主智能体浪潮 — Imaginary_Dinner2710 · 2026-08-05
- DeepSeek Flash 表现惊人,网友直呼“不合理” — yacineMTB · 2026-08-05
- 开发者惊叹 DeepSeek 价格屠夫:可无限极低成本运行 — yacineMTB · 2026-08-05
- DeepSeek V4 Flash 评测对标 GLM 5.2,登顶 OpenRouter — natolambert · 2026-08-05
- DeepSeek-V4-Flash 被指成“怪物”模型,登顶 OpenRouter — natolambert · 2026-08-05
- 开发者预测:DeepSeek V4 凭极高性价比将抢占市场 — tekbog · 2026-08-05
第 5 集 · DeepSeek-V4-Flash发布并全面登陆各大平台(2026-08-06,4 条)
DeepSeek发布最新开源权重模型DeepSeek-V4-Flash-0731,拥有304B参数,性能超越更大体积模型。该模型已全面上线Ollama云端及engy.ai等平台,输出速度超120 tps。其API定价极具竞争力,输入与输出成本比官方及同级模型低30%至68%,主打高效与前沿性能。
- DeepSeek-V4-Flash 发布:304B 参数跑赢更大模型,API 定价仅 $0.14 — JeremyCMorgan · 2026-08-06
- DeepSeek v4 Flash 定价曝光:比同级便宜近 30% — youjiaxuan · 2026-08-07
- DeepSeek V4 Flash 上线,价格比官方低68% — markjeffrey · 2026-08-08
- Ollama 云端全面上线 DeepSeek-V4-Flash,输出速度超 120 tps — ollama · 2026-08-08
第 6 集 · DeepSeek-V4 Flash实测:成本仅Luna六分之一,性能达八成(2026-08-07,14 条)
开发者zainhas基于DeepSWE基准对DeepSeek-V4 Flash 0731与GPT-5.6 Luna进行了软件工程任务实测。核心结论是DeepSeek性价比极高:单任务成本仅$0.10,约为Luna($0.60)的1/6,准确率达Luna的80%(53.3% vs 67.2%)。通过并行多次尝试或与Luna级联的策略,DeepSeek可追平甚至超越Luna,同时大幅降低成本。该对比为开发者选择模型提供了重要参考,凸显了低成本模型在软件工程场景的潜力。
已确认
- 成本与准确率:DeepSeek每任务$0.10,Luna为$0.60,相差约5-6倍;准确率DeepSeek 53.3%,Luna 67.2%,Luna仅高约14个百分点。DeepSeek端到端耗时23分钟。
- 多次尝试效果:DeepSeek经济性允许并行多次尝试,2次尝试(pass@2)准确率81.6%(成本$0.20),4次达90.3%;Luna相应为70.1%和80.5%。
- 级联策略:先用DeepSeek处理,验证失败时升级到Luna,准确率78.9%,成本$0.385,比Luna单模型(67.2%,$0.61)成本降37%(即Luna成本的63%),准确率提升11.7%。
- 任务重叠:两者共同解决87个任务,Luna独解15个,DeepSeek独解仅4个,相关性0.50。
- 领域表现:Luna在7/8个领域胜出,在程序分析(69-33)、并发(70-38)、运行时内部(86-59)等难题上领先约30分;DeepSeek仅在查询与配置(78-70)上占优。DeepSeek在JavaScript上表现崩溃(35-60),Python较弱(49-65),Rust(55-60)和Go(62-79)尚可。
- 失败模式:DeepSeek回归破坏率9%,Luna为15%,DeepSeek失败更优雅,而价格更高的模型反而更需要回归测试来防护。
尚未确认
- 具体测试环境、任务集细节及模型版本信息未在帖子中完整披露。
为什么重要
该实测为开发者提供了明确的成本-性能权衡依据:在预算敏感场景下,DeepSeek-V4 Flash凭借极低成本和可接受的准确率成为高性价比选择;而通过多次尝试或级联策略,可在不显著增加成本的情况下达到甚至超越顶级模型。这有助于推动大模型在软件工程领域的更广泛应用。
- 实测DeepSeek-V4对比GPT-5.6:成本仅1/6,质量达80% — zainhas · 2026-08-07
- Luna贵6倍但准确率仅高14点,DeepSeek性价比完胜 — zainhas · 2026-08-07
- DeepSeek每任务仅$0.10,比Luna便宜5倍 — zainhas · 2026-08-07
- DeepSeek多次尝试可追平Luna:pass@2成本仅$0.20 — zainhas · 2026-08-07
- DeepSeek失败更优雅:回归破坏率9%,Luna达15% — zainhas · 2026-08-07
- Luna在7/8领域胜出,DeepSeek仅守住查询配置 — zainhas · 2026-08-07
- DeepSeek在JavaScript上表现崩溃,Rust和Go尚可 — zainhas · 2026-08-07
- DeepSeek与Luna任务重叠度高:Luna独解15题,DeepSeek仅4题 — zainhas · 2026-08-07
- DeepSeek+验证器级联策略:成本降63%,准确率超Luna单模型 — zainhas · 2026-08-07
- DeepSeek+Luna 组合策略:成本降 37%、准确率提升 11.7% — zainhas · 2026-08-07
- DeepSeek-V4 Flash 软件工程实测:性能达 GPT-5.6 八成 — zainhas · 2026-08-07
- DeepSeek Flash 成本仅 GPT 5.6 Luna 六分之一,质量达 80% — pbaylies · 2026-08-07
- DeepSeek V4 编码性价比登顶:实测比 GPT 5.6 便宜 6 倍 — togethercompute · 2026-08-07
- DeepSeek级联方案实测:编码任务胜率超GPT-5.6且成本降37% — togethercompute · 2026-08-08