Marin 启动 535B-A23B 开放训练:18.75T tokens、11 组 GB200 跑约 3 个月
_ScottCondron · x · 2026-08-23
Percy Liang 团队的 Marin 宣布本周开始训练 535B 参数(激活 23B)模型,全程开放。计划在 11 台 GB200 NVL72 上用约 3 个月(2.7e24 FLOPs)完成预训练 80% + 中期训练 20%,共 18.75T tokens,之后进行后训练。开工前团队先跑了从 1.6B-A61M(48B tokens)到 27.7B-A1.2B(926B tokens)的 4 级 scaling 阶梯实验,用于排障并对主训练做出预测。这是 Marin 迄今最大规模的一次训练。
所属事件:斯坦福 Marin 开源 23T token 数据并启动 535B 透明训练(6 条相关)→
「研究」频道最新
- Pixel32Bench:对比模型在 32×32 像素上的创作 — TheMoonMidas · 2026-08-23
- AI 加速材料发现:云实验室与模拟结合的机会 — JacquesThibs · 2026-08-23
- Marin 535B 模型启动全透明训练,公开 FLOPs 与配置 — _ScottCondron · 2026-08-23
- 开发者称 MCP 研究论文错误百出、疑部分由 AI 生成 — benfielding · 2026-08-23
- NanoGPT 速通排行榜汇总:最快训练与性能基准 — RichmanRonald · 2026-08-23
- Prompt Injection 损失极小?攻击成本降低或带来新风险 — joshua_saxe · 2026-08-23