开源535B MoE模型Marin启动训练
stanfordnlp · x · 2026-08-22
Stanford NLP 团队启动了开源模型 Marin 535B-A23B 的训练。该模型将在 11 台 GB200 NVL72 集群上训练约 3 个月,处理 18.75T tokens,计算量达 2.7e24 FLOPs。训练计划包括 80% 预训练和 20% 中间训练。团队此前通过从 1.6B 到 27.7B 的扩展阶梯调试了问题并预测了主运行情况。该项目全程公开,旨在推动越来越封闭的研究环境下的透明度。
所属事件:斯坦福 Marin 启动 535B 模型全透明训练并开源 23T token 数据(7 条相关)→
「Infra」频道最新
- Perplexity 转向端侧:敏感数据交给本地小模型处理 — HowDevelop · 2026-09-07
- 四卡 3090 跑 Qwen3.8-Flash-Next,自建 P2P 驱动冲到 361.7 tok/s — QuixiAI · 2026-09-07
- Merge Gateway 推出 DeepSeek V4 Flash 七五折:输入每百万 token 仅 4 美分 — shensi · 2026-09-07
- Qwen 3.8 Flash Next 量化版上 M3 Ultra 跑出 65 tokens/s — ivanfioravanti · 2026-09-07
- 「自托管 AI」的神话:本地模型仍绕不开云在环 — nomad-nostalgia · 2026-09-07
- 四卡 4090 本地跑模型:vLLM+P2P 补丁还是 llama.cpp 选谁 — dowitex · 2026-09-07