Marin利用Scaling Law预测训练轨迹,启动535B MoE
dlwh · x · 2026-08-21
Marin 团队发现缩放定律可以模拟整个训练轨迹。在最近的 67B MoE 训练中,模型不仅最终损失命中目标(误差<1%),且训练过程中的任意点也能被准确预测(误差<1%)。基于此,他们使用了“Scaling Ladder”策略来模拟刚启动的 535B MoE 模型的训练表现,以提前发现潜在Bug。该团队还指出,成功的训练运行不仅仅是调整架构,更涉及海量Token的清洗和新GPU栈的硬件适配等艰巨工作。
「Infra」频道最新
- Shopify 实战 Gisting:压缩上下文提速降本 — MParakhin · 2026-08-21
- 微软高管力推 Gisting:端到端延迟降 40%,吞吐量升 15% — MParakhin · 2026-08-21
- Liquid AI 推出 DSpark:推测解码提速最高 3.18 倍 — helloiamleonie · 2026-08-21
- Shopee 自建大模型:API 调用 8 月百倍,欺诈检测提速 50 倍 — nvidia · 2026-08-21
- AI 算力缺电:电网成瓶颈,太阳能与储能是当前最快解 — PeterDiamandis · 2026-08-21
- ForkUnion开源SmashTable:带DBMS事务特性的内存容器 — srchvrs · 2026-08-21