斯坦福启动 535B 模型 Marin 训练,全流程开源
soumitrashukla9 · x · 2026-08-22
Stanford CRFM 宣布 Marin 535B-A23B 模型本周开始训练,预训练加中期训练将使用 18.75T tokens,部署在 11 套 GB200 NVL72 集群上,预计耗时约 3 个月,算力消耗达 2.7e24 FLOPs。
为保障此次最大规模训练的稳定性,团队提前构建了包含 1.6B 至 27.7B 的 4 级扩展阶梯进行调试与预测。该项目的核心原则延续自 5 年前发布的 Mistral 框架:简洁性、社区化、灵活性、透明度、可复现性、教学性与可扩展性。
所属事件:斯坦福开源训练 535B 参数 Marin 模型(2 条相关)→
「Infra」频道最新
- 数据中心耗水争议:10GW 规模年用水 1200 亿加仑 — SumitGup · 2026-08-22
- OpenBot 开源:为每个 AI 提供独立容器与策略网关 — aigclink · 2026-08-22
- MiniMax-H3 量化发布:为何保留 FC2 层为 BF16 — marres · 2026-08-22
- 核能热岩发电量巨大,对比需维护的被动太阳能 — tawnniee · 2026-08-22
- 2-4K 显卡可日供 100T Token,算力效率引热议 — teortaxesTex · 2026-08-22
- 苹果或推 1TB+ 统一内存芯片,影响分布式训练 — benfielding · 2026-08-22