Marin利用Scaling Law预测训练轨迹,启动535B MoE

dlwh · x · 2026-08-21

Marin 团队发现缩放定律可以模拟整个训练轨迹。在最近的 67B MoE 训练中,模型不仅最终损失命中目标(误差<1%),且训练过程中的任意点也能被准确预测(误差<1%)。基于此,他们使用了“Scaling Ladder”策略来模拟刚启动的 535B MoE 模型的训练表现,以提前发现潜在Bug。该团队还指出,成功的训练运行不仅仅是调整架构,更涉及海量Token的清洗和新GPU栈的硬件适配等艰巨工作。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →