DeepSeek V4-Flash成本骤降百倍,引发AI经济学争议
DeepSeek V4-Flash-0731 模型近期引发关于大模型真实推理成本的广泛讨论。据 Artificial Analysis 数据,该模型在 Terminal-Bench 2.1 评测中以 82.7 分逼近 Fable 5 的 80.5 分,且完成相同基准任务的总成本仅为后者的 1/105。这一现象促使业界重新审视 AI 经济学指标,但也引发了关于其实际应用稳定性、计费方式误导性以及综合能力的争议。
已确认
- 在 Terminal-Bench 2.1 评测中,DeepSeek V4-Flash 得分为 82.7 分,与 Fable 5 的 80.5 分表现近乎一致。
- 据 Artificial Analysis 实测报告,DeepSeek 完成相同基准任务的整体成本比 Fable 5 低 105 倍。
- 该模型输出定价为 $0.28/M,恰好与 OpenAI 降价 80% 后(叠加 OpenRouter 促销至 $0.60/M)的 GPT-5.6 Luna 落入同一价格区间。
尚未确认
- API 稳定性与实际总成本:开发者 @kmsdev 在 34 个提示词的测试中发现,该模型在 OpenRouter 上的供应商表现不稳定,多次生成失败,且最终花费 1.29 美元,在性能与成本上均不敌 Kimi K3。
- 单 token 定价的误导性:@cephaloform 与投资人 Chamath 等人指出,尽管 DeepSeek 每 token 价格极低,但如果模型需要更多轮次才能完成任务,其实际总成本反而可能更高,低价可能具有误导性。
为什么重要
- 评价体系的转变:@mustafamhus 与 @AravSrinivas 均指出,这种两个数量级的成本下降极其罕见,堪称 DeepSeek 的“2.0 时刻”。这要求企业决策者和开发者跳出传统的单 token 定价思维,开始真正关注“单次任务成本”。@intellectronica 更是称其为便宜到无法计量的时刻。
- 开源模型横向对比:在具体的游戏生成等任务实测中(@mustafamhus),DeepSeek V4-Flash 虽然成本极低,但在得分上依然落后于 Kimi K3(9.5/10,花费 $0.0740)和 GLM 5.2(9/10,花费 $0.0480),表明单纯追求成本下降并不能完全替代模型间的综合能力竞争。
2026-08-01 ~ 2026-08-03 · 11 条相关
一手来源
- DeepSeek V4-Flash以105倍低成本完成基准任务,但单token低价或误导 — cephaloform ·
- DeepSeek V4-Flash推理成本骤降百倍,被指迎来2.0时刻 — AravSrinivas ·
- Kimi K3 与 GLM 5.2 实测:DeepSeek V4 Flash 便宜 150 倍 — mustafamhus ·
- DeepSeek-V4-Flash 评测翻车:得分与成本均不敌 Kimi K3 — kms_dev · 2026-08-01
- 【源头】DeepSeek V4-Flash以105倍低成本完成基准任务,但单token低价或误导 — cephaloform · 2026-08-02
- 【源头】DeepSeek V4-Flash推理成本骤降百倍,被指迎来2.0时刻 — AravSrinivas · 2026-08-02
- DeepSeek完成同任务成本仅为竞品1/105 — JosephJacks_ · 2026-08-02
- DeepSeek V4-Flash 基准测试成本仅为 Fable 的 1/105 — zainhas · 2026-08-02
- DeepSeek V4-Flash 逼近 Fable 5,AI 竞争转向性价比 — mustafamhus · 2026-08-02
- 【源头】Kimi K3 与 GLM 5.2 实测:DeepSeek V4 Flash 便宜 150 倍 — mustafamhus · 2026-08-02
- DeepSeek V4 Flash发布:AI推理成本“便宜到无法计量” — intellectronica · 2026-08-02
- DeepSeek V4 Flash 与 OpenAI Luna 同价位实测对比 — eyishazyer · 2026-08-02
- 实测 DeepSeek V4 Flash:能力比肩竞品且成本降 34 倍 — mattturck · 2026-08-03
另有 1 条近重复转述:mustafamhus