DeepSeek-V3训练仅用18万GPU小时,极致摊薄MoE算力成本
teortaxesTex · x · 2026-08-01
推文对比了 DeepSeek 历代模型的训练算力消耗:V1 版本每训练 1T tokens 需消耗 30 万小时 H800,而 V2 和 V3 分别降至 17.3 万和 18 万小时。作者推算其下一代模型(V4-Flash)可能仅需约 6.6 万小时,总成本约 200 万 GPU 小时。
这意味着 DeepSeek 当前最强模型的体积与训练成本,甚至比 26 个月前的版本更低。作者借此高度赞赏了 DeepSeek 在 MoE(混合专家模型)架构上的 Scaling laws 验证,并指出其透明的推理单位经济效益,与西方前沿 AI 公司在算力与利润率上遮遮掩掩的态度形成鲜明对比。
所属事件:DeepSeek历代模型训练算力成本大幅下降(2 条相关)→
「Infra」频道最新
- antirez 实现 DeepSeek v4 Flash 无损 MXFP4 本地运行 — antirez · 2026-08-01
- 3张2080Ti跑Qwen 27B达55tps,最佳配置分享 — AccountGotLocked69 · 2026-08-01
- 塔塔集团拟与 ASML 合作,推进先进芯片设备在印度本地化制造 — prasanna_says · 2026-08-01
- 实测 3bit 27B 模型在强化学习中跑出可用速度 — cephaloform · 2026-08-01
- 斯坦福教授探讨高速互联技术:Scaling 趋势或将见顶 — jwt0625 · 2026-08-01
- Google 新论文 FLARE:注意力机制降耗 600 倍,或助力端侧大模型 — dejanseo · 2026-08-01