DeepSeek-V3训练仅用18万GPU小时,极致摊薄MoE算力成本

teortaxesTex · x · 2026-08-01

推文对比了 DeepSeek 历代模型的训练算力消耗:V1 版本每训练 1T tokens 需消耗 30 万小时 H800,而 V2 和 V3 分别降至 17.3 万和 18 万小时。作者推算其下一代模型(V4-Flash)可能仅需约 6.6 万小时,总成本约 200 万 GPU 小时。

这意味着 DeepSeek 当前最强模型的体积与训练成本,甚至比 26 个月前的版本更低。作者借此高度赞赏了 DeepSeek 在 MoE(混合专家模型)架构上的 Scaling laws 验证,并指出其透明的推理单位经济效益,与西方前沿 AI 公司在算力与利润率上遮遮掩掩的态度形成鲜明对比。

所属事件:DeepSeek历代模型训练算力成本大幅下降(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →