训练10万亿参数模型需5万张以上GB300

AccBalanced · x · 2026-08-09

推文分析了训练超大参数模型所需的算力规模。指出训练 10万亿(10T)参数 的模型至少需要 5万到6万张英伟达 GB300,以及 150T 到 200T 的训练 tokens。

相比之下,3万张 GPU 仅够训练 5T 到 6T 参数的模型。此前有观点认为 3万张 GPU 足够预训练一个巨型模型,但算力瓶颈实际上更多转移到了推理侧,未来厂商大概率会通过蒸馏较小的模型来提供服务。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →