专题 · FULL STORY

DeepSeek-V4-Flash发布及跑分与计费争议

DeepSeek-V4-Flash正式开启公测,其Agent能力大幅跃升。跑分数据显示该模型智能指数达50分反超Pro版,但随之而来的计费争议与对下一代模型的定价预测引发了社区热议。

2026-07-31 ~ 2026-07-31 · 4 集 · 35 条

第 1 集 · DeepSeek-V4-Flash正式版API公测,Agent能力大幅跃升(2026-07-31,22 条)

7 月 31 日,DeepSeek 官方宣布 DeepSeek-V4-Flash 正式版 API 上线并开启公测,用户将模型名设为 deepseek-v4-flash 即可调用。本次更新未改变模型结构与尺寸,主要通过重新后训练实现了 Agent 能力的全面跃升,多项基准测试得分显著超越此前的 V4-Pro-Preview。官方同步预告 V4-Pro 正式版即将于 8 月初上线,这标志着 DeepSeek 在智能体应用场景下的实用性与竞争力得到进一步增强。

已确认

  • API 与架构:DeepSeek-V4-Flash 正式版 API 现已开放公测。模型采用 MoE 架构(总参数 284B,激活 13B),支持 100 万 token 上下文,结构与 Preview 版保持一致。原生支持 OpenAI 的 Responses API 格式,全面适配 Codex,并推出了一键配置脚本。
  • Agent 能力跃升:官方确认 V4-Flash 正式版的智能体能力大幅提升。在已曝光的评测中,TerminalBench2.1 得分从 56.9 跃升至 82.7,Toolathlon 从 51.8 提升至 70.3,DeepSWE 测试得分达到 54%(较预览版暴涨 7.5 倍)。此外,在 DSBench-FullStack 等内部测试集上的表现也显著优于 Preview 版。
  • 官方澄清与预告:官方明确本次升级仅限 V4-Flash 的 API,V4-Pro 的 API 及 App/Web 端模型目前保持不变。V4-Pro 正式版即将于 8 月初发布。

尚未确认

  • 关于后续是否会开放 V4-Flash 模型权重,目前仅有外界基于 DeepSeek 过往开源策略的推测,官方尚未公布具体时间表。

为什么重要

  • V4-Flash 正式版在保持原有模型结构的基础上,仅通过重新后训练就实现了 Agent 能力的跨越式提升,为开发者提供了更强大的任务执行与工具调用模型选择。同时,其原生兼容 Codex 及极具竞争力的成本优势,进一步降低了智能体开发门槛。

还有 2 条相关讨论 →

第 2 集 · DeepSeek-V4-Flash 跑分达 50 分反超 Pro 版(2026-07-31,7 条)

DeepSeek-V4-Flash-0731 正式版跑分出炉,在 Artificial Analysis 智能指数中获得 50 分,较前代跃升 10 分并反超自家 V4-Pro-Preview 6 分。该成绩逼近行业顶尖模型,展现出极高的性价比,引发社区对 DeepSeek 研发速度的广泛关注。

已确认

  • Artificial Analysis 评测报告确认 DeepSeek-V4-Flash-0731 智能指数为 50 分
  • 该分数较前代提升 10 分,反超 DeepSeek-V4-Pro-Preview 6 分
  • 成绩仅落后 GLM-5.2 和 GPT-5.6 Luna 1 分
  • 在编程与智能体等基准测试中表现逼近顶级模型 Opus 4.8
  • 在智能与成本的帕累托前沿上表现优异,性价比超越刚降价 80% 的 GPT-5.6 Luna (xhigh)

为什么重要

  • DeepSeek 在短短一个半月内的迭代更新中,能力几乎追平 GLM 5.2 等顶尖模型,研发速度惊人
  • Flash 版本跑分大幅超越 Pro 预览版,表明 DeepSeek 的技术路线取得显著突破
  • 在 GPT-5.6 Luna 宣布降价 80% 的背景下,DeepSeek-V4-Flash 仍能在性价比上胜出,竞争力极强
  • 持续保持在 AI 竞赛核心梯队,低调而快速的迭代策略成效显著

第 3 集 · DeepSeek-V4-Flash跑分曝光但陷计费争议(2026-07-31,4 条)

泄露信息显示 DeepSeek-V4-Flash 在多项基准测试中表现优异,智能指数达 50 分,与 Gemini 3.6 Flash 持平,单次推理成本仅 0.2 美元。然而,有开发者反馈该模型 API 出现异常高昂的缓存写入费用。若剔除该异常成本,其性价比将大幅领先 GPT;但若按当前计费执行,其并发定价曲线将被彻底打破。目前推测这可能是计费环节出现的错误。

第 4 集 · DeepSeek V4 性能与定价预测引热议(2026-07-31,2 条)

当前 AI 模型市场的价格战异常激烈,DeepSeek 的激进定价策略备受瞩目。社区与博主纷纷对其下一代模型 V4-PRO 展开预测,预计其性能将比肩 Anthropic 的 Claude Opus 4.8,且定价会继续击穿行业底线。尽管部分现有模型表现尚未完全达到预期,但这种极具破坏力的低价策略不仅令业界惊叹,也让大众对 DeepSeek 未来产品的发布充满期待。