专题 · FULL STORY

斯坦福Marin:全透明训练535B模型

斯坦福Percy Liang团队的Marin项目公开约23万亿token预训练数据,随后启动535B总参、23B激活模型的全透明开源训练,数周内进度已达13%,全程向社区开放。

2026-08-22 ~ 2026-09-07 · 2 集 · 9 条

第 1 集 · 斯坦福 Marin 启动 535B 模型全透明训练并开源 23T token 数据(2026-08-22,7 条)

斯坦福 CRFM/NLP 的 Marin 项目(Percy Liang 团队)近期有两项关键动作:一是公开约 23 万亿 token 的预训练数据,二是启动 535B 参数 MoE 模型的全程透明训练。这是开放科学在 frontier 规模上的一次少见尝试,为社区提供了可复现、可实时围观的一手素材。

已确认

  • Marin 开源了约 23 万亿 token 的预训练数据,可通过 S3 存储桶公开下载;数据集组成、模型架构、基础设施与内核细节均发布在 GitHub,训练过程可在 wandb 上实时观看(@joecole 转述)。
  • 团队本周开始训练 535B-A23B(总参数 535B,激活 23B)模型,采取全开放模式:预训练占 80%、中期训练占 20%,合计约 18.75T tokens、2.7e24 FLOPs(@ScottCondron、@ysunlp、@soumitrashukla9 等多条帖子转述一致)。
  • 硬件配置为 11 组 GB200 NVL72 集群,预计耗时约 3 个月。@stanfordnlp 补充该模型为 MoE 架构。
  • 正式运行前,团队已通过 1.6B 起步的小规模实验逐步验证(@ysunlp 转述)。

为什么重要

  • 主流大模型极少公开预训练数据全貌,Marin 把 23T token 数据、训练代码与基础设施细节全部开放,为社区提供了可复现、可研究的一手素材。
  • 535B 级模型以完全透明、可实时围观的方式训练,且披露了 token 数、FLOPs、集群规模等具体数字,是开放科学在 frontier 规模上的一次少见尝试。

第 2 集 · 斯坦福 Marin 开源训练 535B 模型,进度已达 13%(2026-09-05,2 条)

斯坦福 Percy Liang 宣布完全开源的大模型训练项目 Marin 本周开训,模型规模 535B 总参/23B 激活,训练进度已达 13%。全程公开,包含预训练(80%)与中期训练(20%),共 18.75T tokens、2.7e24 FLOPs,使用 11 台 GB200,预计约 3 个月完成。算力由 CoreWeave 提供。