训练10万亿参数模型需5万张以上GB300
AccBalanced · x · 2026-08-09
推文分析了训练超大参数模型所需的算力规模。指出训练 10万亿(10T)参数 的模型至少需要 5万到6万张英伟达 GB300,以及 150T 到 200T 的训练 tokens。
相比之下,3万张 GPU 仅够训练 5T 到 6T 参数的模型。此前有观点认为 3万张 GPU 足够预训练一个巨型模型,但算力瓶颈实际上更多转移到了推理侧,未来厂商大概率会通过蒸馏较小的模型来提供服务。
「Infra」频道最新
- 预测市场:年底前美国某州出台数据中心禁令概率达 73% — Polymarket · 2026-08-09
- 亚马逊德州数据中心碳排放将超全美任何发电厂 — Polymarket · 2026-08-09
- RTX 4090 跑 MiniMax H3 实测:2MP 分辨率约 16 s/it — jugernaut126 · 2026-08-09
- AI算力打破美国用电停滞,终结反增长思维 — AndyMasley · 2026-08-09
- 4070 Ti 跑 GPT-OSS 120B 达 21 tok/s:利用 MoE 缓存暴力魔改 — JayB_Official · 2026-08-09
- 亚马逊为德州数据中心建专属电厂,或成全美最大温室气体排放源 — The Verge AI · 2026-08-09