斯坦福 Marin 启动 535B-A23B 开源巨模训练
斯坦福 Percy Liang 主导的开源协作项目 Marin 启动了迄今最大规模的全程公开训练(hero run):一个总参数 535B、激活参数 23B 的 MoE 模型,计划在约 18 万亿 token(含 agentic、代码与科学数据)上预训练约 3 个月,目前进度已达约 13%。该项目现已并入 Open Athena 社区。这是开源 AI 研究迈向「巨型模型全程可复现、可追踪」的重要一步。
已确认
- 模型规模:535B 总参数、23B 激活参数的 MoE 架构,训练数据规模 18T tokens(@dlwh、@percyliang)。
- 当前进度约 13%(@percyliang,09-03 披露)。
- 算力资金来自 Jen-Hsun and Lori Huang 基金会(即黄仁勋夫妇基金会),算力由 CoreWeave 提供(@percyliang)。
- 全部代码流水线、训练日志、架构、数据与损失预测均公开在 GitHub,全程可追踪(@dlwh、@TheTuringPost)。
- @dlwh 称这是 Marin 加入 Open Athena 一年来的年度收官训练;@BrandoHablando 转述其描述称几周来进展「几乎无聊地顺利」。
为什么重要
- 主流前沿级大模型训练细节普遍封闭,Marin 把架构、数据配比、损失预测与训练日志全部开源,为社区提供了可复现的巨模预训练参照。
- 黄仁勋基金会出资支持开源学术训练,显示产业资本对开放式前沿研究的投入,且选择了社区驱动的 Marin/Open Athena 路线。
2026-09-03 ~ 2026-09-04 · 5 条相关
一手来源
- 斯坦福 Marin 535B-A23B 开训,黄仁勋基金会出资算力支持 — percyliang ·
- 开源阵营 Marin 启动 535B/23B MoE 巨型预训练,全程公开可追踪 — dlwh ·
- 【源头】斯坦福 Marin 535B-A23B 开训,黄仁勋基金会出资算力支持 — percyliang · 2026-09-03
- Open Athena 开训 535B MoE 模型 Marin:18T tokens 全程公开 — TheTuringPost · 2026-09-03
- 【源头】开源阵营 Marin 启动 535B/23B MoE 巨型预训练,全程公开可追踪 — dlwh · 2026-09-03
- 黄仁勋基金会出资,Marin 535B-A23B 开源模型训练完成 13% — dlwh · 2026-09-04
- 开源项目 Marin 启动 535B/A23B MoE 大规模训练,进展顺利 — BrandoHablando · 2026-09-04