斯坦福启动 535B 模型 Marin 训练,全流程开源

soumitrashukla9 · x · 2026-08-22

Stanford CRFM 宣布 Marin 535B-A23B 模型本周开始训练,预训练加中期训练将使用 18.75T tokens,部署在 11 套 GB200 NVL72 集群上,预计耗时约 3 个月,算力消耗达 2.7e24 FLOPs。

为保障此次最大规模训练的稳定性,团队提前构建了包含 1.6B 至 27.7B 的 4 级扩展阶梯进行调试与预测。该项目的核心原则延续自 5 年前发布的 Mistral 框架:简洁性、社区化、灵活性、透明度、可复现性、教学性与可扩展性。

所属事件:斯坦福开源训练 535B 参数 Marin 模型(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →