开源535B MoE模型Marin启动训练

stanfordnlp · x · 2026-08-22

Stanford NLP 团队启动了开源模型 Marin 535B-A23B 的训练。该模型将在 11 台 GB200 NVL72 集群上训练约 3 个月,处理 18.75T tokens,计算量达 2.7e24 FLOPs。训练计划包括 80% 预训练和 20% 中间训练。团队此前通过从 1.6B 到 27.7B 的扩展阶梯调试了问题并预测了主运行情况。该项目全程公开,旨在推动越来越封闭的研究环境下的透明度。

所属事件:斯坦福 Marin 启动 535B 模型全透明训练并开源 23T token 数据(7 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →