数亿美元算力验证:Layer-loop 比 Model-loop 更适合 MoE 预训练

teortaxesTex · x · 2026-07-21

第一作者表示,他们投入了数亿美元算力去验证经典的 Universal Transformer,也就是所谓的 **model-loop** 方案。 结论是:这个方案在上十亿参数的 MoE 模型上扩展性并不好。到了预训练后期,团队提出的 **layer-loop** 方法不仅超过了 model-loop,并且一直保持优势;同时它对基础设施更友好,更适合大规模 pipeline parallelism。 作者还强调,在相同理论 FLOPs 下,loop 方案可以优于非 loop 基线;而 model-loop 会让参数和梯度之间的距离更远,规模越大越可能拖慢训练。

所属事件:Loopie循环Transformer发布,同算力击败30B基线(6 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →