Marin 535B 模型启动全透明训练,公开 FLOPs 与配置
_ScottCondron · x · 2026-08-23
Marin 项目启动了迄今为止规模最大的开源模型训练:535B 参数(Active 23B)。该项目以极高的透明度公开了训练全过程:
- 算力配置:使用 11 台 GB200 NVL72 集群。
- 训练计划:预训练 80% + 中间训练 20%,总计 18.75T tokens,预计耗时 3 个月,计算量为 2.7e24 FLOPs。
- 透明度:可视化展示各领域的预训练混合比例、采样文档、实时训练损失、配置详情及缩放定律。
在启动主训练前,团队通过从 1.6B 到 27.7B 的 4 级缩放梯子进行了调试和预测。
所属事件:斯坦福 Marin 开源 23T token 数据并启动 535B 透明训练(6 条相关)→
「Infra」频道最新
- ComfyUI Trellis 2 RDNA3/3.5/4 Windows 安装教程 — Wake_Up_Morty · 2026-08-23
- 开源项目 pgrok:自建 VPS 替代 ngrok — tom_doerr · 2026-08-23
- 数据中心反对声浪与 AI 行业扩张的矛盾 — NathanpmYoung · 2026-08-23
- RTX A6000 换硅脂装风扇,我终于敢跑模型了 — cephaloform · 2026-08-23
- 大神为 AMD GFX906 显卡优化了 llama.cpp — milpster · 2026-08-23
- Nvidia AI 服务器涨价超 15%,GB300 售价约 60 万美元 — zephyr_z9 · 2026-08-23