DeepSeek历代模型训练算力成本大幅下降

DeepSeek 在模型训练算力优化上取得显著成效,其历代版本每训练 1T tokens 的 GPU 消耗量呈现大幅下降趋势。数据显示,从 V1 版本需要 30 万 H800 GPU 时,降至 V2 的 17.3 万与 V3 的 18 万。而最新的 V4-Flash 模型更是将算力开销暴降至 6.6 万 GPU 时,极致摊薄了 MoE 架构的计算成本。

2026-08-01 ~ 2026-08-01 · 2 条相关