数亿美元算力验证:Layer-loop 比 Model-loop 更适合 MoE 预训练
teortaxesTex · x · 2026-07-21
第一作者表示,他们投入了数亿美元算力去验证经典的 Universal Transformer,也就是所谓的 **model-loop** 方案。 结论是:这个方案在上十亿参数的 MoE 模型上扩展性并不好。到了预训练后期,团队提出的 **layer-loop** 方法不仅超过了 model-loop,并且一直保持优势;同时它对基础设施更友好,更适合大规模 pipeline parallelism。 作者还强调,在相同理论 FLOPs 下,loop 方案可以优于非 loop 基线;而 model-loop 会让参数和梯度之间的距离更远,规模越大越可能拖慢训练。
所属事件:Loopie循环Transformer发布,同算力击败30B基线(6 条相关)→
「Infra」频道最新
- CleanAir 用 3D U-Net 代理 CMAQ,一年模拟压到 10 秒 — bravo_abad · 2026-07-21
- OxDeAI 用签名授权把 agent 策略检查前移到执行前 — docybo · 2026-07-21
- LLM 单次成本翻三倍,原因不是流量而是重试和 prompt 膨胀 — Lance_Saul_85 · 2026-07-21
- NVIDIA CMP 170HX 卖家在 jailbreak 传闻后把价格翻倍 — Hannibalj2ca · 2026-07-21
- AI 性能瓶颈正转向材料科学,而不只是算力 — nordicinst · 2026-07-21
- GLM-5.2 推理争论:750B 参数怎么跑过 1 token/s — francoisfleuret · 2026-07-21