Marin 团队开训史上最大全开放模型:535B 参数、18T tokens,进度已 15%
Thom_Wolf · x · 2026-09-04
Andy Konwinski 与 Percy Liang 宣布 Marin 团队正在训练迄今最大的完全开放模型 Marin 535B-A23B(MoE,总参 535B、激活 23B),计划用 18T tokens,已完成约 15%(2.65T tokens)。
要点:
- 透明度空前:不止权重,数据、日志与所有训练决策全部开放,可实时跟踪训练进度(Tracker 页面持续更新)
- 算力由 Jen-Hsun 和 Lori Huang 基金会资助(CoreWeave 提供),Percy Liang 公开感谢黄仁勋对开源模型的支持
- 训练细节:9 月 2 日换回原 expert-routing 后端后已稳定运行近 20 小时;尝试的 ragged all-to-all 后端两次挂起,相关 gate/router weight decay 修复 PR 仍未合并,等下一个 step 60,000 固定 checkpoint 时重启
- Thom Wolf(Hugging Face 创始人)转发表示持续关注
所属事件:Marin 启动 535B 全开放模型训练,黄仁勋基金会出资(8 条相关)→
「Infra」频道最新
- 24小时AI直播成本账:fal 每天约3450美元,Seedance 超4万 — FinanceYF5 · 2026-09-04
- 开源语音管线接入 Smart Turn 端点检测,误触 LLM 调用减少 — ivan_digital · 2026-09-04
- vLLM 核心团队创立 Inferact,为 HUMAIN-M3 阿拉伯模型做推理 — woosuk_k · 2026-09-04
- Domingos 放话:把 LLM 效率翻倍,就该值千亿美元 — pmddomingos · 2026-09-04
- SemiAnalysis:AMD MI355x 每美元 token 产出击败英伟达 B300 — AnushElangovan · 2026-09-04
- Liquid 发布 Nanos 系列:350M-2.6B 专用小模型主打端侧 Agent — JosephJacks_ · 2026-09-04