专题 · FULL STORY
斯坦福Marin:全透明训练535B模型
斯坦福Percy Liang团队的Marin项目公开约23万亿token预训练数据,随后启动535B总参、23B激活模型的全透明开源训练,数周内进度已达13%,全程向社区开放。
2026-08-22 ~ 2026-09-07 · 2 集 · 9 条
第 1 集 · 斯坦福 Marin 启动 535B 模型全透明训练并开源 23T token 数据(2026-08-22,7 条)
斯坦福 CRFM/NLP 的 Marin 项目(Percy Liang 团队)近期有两项关键动作:一是公开约 23 万亿 token 的预训练数据,二是启动 535B 参数 MoE 模型的全程透明训练。这是开放科学在 frontier 规模上的一次少见尝试,为社区提供了可复现、可实时围观的一手素材。
已确认
- Marin 开源了约 23 万亿 token 的预训练数据,可通过 S3 存储桶公开下载;数据集组成、模型架构、基础设施与内核细节均发布在 GitHub,训练过程可在 wandb 上实时观看(@joecole 转述)。
- 团队本周开始训练 535B-A23B(总参数 535B,激活 23B)模型,采取全开放模式:预训练占 80%、中期训练占 20%,合计约 18.75T tokens、2.7e24 FLOPs(@ScottCondron、@ysunlp、@soumitrashukla9 等多条帖子转述一致)。
- 硬件配置为 11 组 GB200 NVL72 集群,预计耗时约 3 个月。@stanfordnlp 补充该模型为 MoE 架构。
- 正式运行前,团队已通过 1.6B 起步的小规模实验逐步验证(@ysunlp 转述)。
为什么重要
- 主流大模型极少公开预训练数据全貌,Marin 把 23T token 数据、训练代码与基础设施细节全部开放,为社区提供了可复现、可研究的一手素材。
- 535B 级模型以完全透明、可实时围观的方式训练,且披露了 token 数、FLOPs、集群规模等具体数字,是开放科学在 frontier 规模上的一次少见尝试。
- Marin 535B 模型启动训练,全程透明开源 — ysu_nlp · 2026-08-22
- 斯坦福启动 535B 模型 Marin 训练,全流程开源 — soumitrashukla9 · 2026-08-22
- Marin开源23万亿token预训练数据,可公开下载 — joecole · 2026-08-22
- 开源535B MoE模型Marin启动训练 — stanfordnlp · 2026-08-22
- Marin 启动 535B-A23B 开放训练:18.75T tokens、11 组 GB200 跑约 3 个月 — _ScottCondron · 2026-08-23
- Marin 535B 模型启动全透明训练,公开 FLOPs 与配置 — _ScottCondron · 2026-08-23
- 斯坦福 Marin 535B 模型开训,全程公开 — udmrzn · 2026-08-24
第 2 集 · 斯坦福 Marin 开源训练 535B 模型,进度已达 13%(2026-09-05,2 条)
斯坦福 Percy Liang 宣布完全开源的大模型训练项目 Marin 本周开训,模型规模 535B 总参/23B 激活,训练进度已达 13%。全程公开,包含预训练(80%)与中期训练(20%),共 18.75T tokens、2.7e24 FLOPs,使用 11 台 GB200,预计约 3 个月完成。算力由 CoreWeave 提供。
- Percy Liang 开源训练 Marin 535B-A23B,进度已达 13% — stanfordnlp · 2026-09-05
- 斯坦福 Marin 开训 535B-A23B 开源模型:18.75T tokens、2.7e24 FLOPs、约 3 个月 — burny_tech · 2026-09-07