数亿美元算力验证:Layer-loop 比 Model-loop 更适合 MoE 预训练
teortaxesTex · x · 2026-07-21
第一作者表示,他们投入了数亿美元算力去验证经典的 Universal Transformer,也就是所谓的 model-loop 方案。
结论是:这个方案在上十亿参数的 MoE 模型上扩展性并不好。到了预训练后期,团队提出的 layer-loop 方法不仅超过了 model-loop,并且一直保持优势;同时它对基础设施更友好,更适合大规模 pipeline parallelism。
作者还强调,在相同理论 FLOPs 下,loop 方案可以优于非 loop 基线;而 model-loop 会让参数和梯度之间的距离更远,规模越大越可能拖慢训练。
所属事件:Loopie循环式Transformer发布,以极低成本追平大模型(7 条相关)→
「Infra」频道最新
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11