DeepSeek V4-Flash 算力消耗暴降:每 1T tokens 仅需 6.6 万 GPU 时
teortaxesTex · x · 2026-08-01
推文梳理了 DeepSeek 历代模型训练算力消耗的演变:从 V1 的 30 万 H800 GPU 时/1T tokens,降至 V2 的 17.3 万,V3 为 18 万,而最新的 V4-Flash 预计仅需约 6.6 万 GPU 时。
在推理端,V4-Flash 与 V2 的输入输出价格基本持平,但缓存命中成本便宜了 5 倍,速度提升了 3 到 4 倍。这表明当前最强模型的体积和成本已显著低于 26 个月前的版本。
所属事件:DeepSeek历代模型训练算力成本大幅下降(2 条相关)→
「Infra」频道最新
- 告别每月200美元订阅费:本地AI部署的十个降本阶梯 — jason_mayes · 2026-08-01
- 本地运行 MXFP4 实测:OpenRouter 上的 DS4 Flash 供应商质量参差不齐 — antirez · 2026-08-01
- DeepSeek V4 Flash 本地跑分追平 5 个月前顶级模型 — joorklee · 2026-08-01
- 新方法实现MoE模型提前路由,大幅优化端侧流式推理I/O瓶颈 — dai_app · 2026-08-01
- 5TB数据存储于微小玻璃片,微观存储技术新突破 — TansuYegen · 2026-08-01
- antirez 实现 DeepSeek v4 Flash 无损 MXFP4 本地运行 — antirez · 2026-08-01