经典 Universal Transformer 验证花了数十亿美元,却难扩展到 MoE
teortaxesTex · x · 2026-07-21
## 经典 Universal Transformer 验证花了数十亿美元,但在大规模 MoE 上不够扩展 Zitian Gao 解释说,团队在验证经典 **Universal Transformer** 路线——他们称之为 **“model-loop”**——上花了**数十亿美元**。核心结论是: - 这种 model-loop **不适合扩展到拥有数十亿参数的 MoE 模型**。 - 在预训练后期,传统 model-loop **表现不如 layer-loop**。 - 随着模型变大,它还需要更复杂的 **pipeline parallelism**,训练会更慢。 - 由于 non-loop 模型在参数化上更自由,只按理论 FLOPs 比较并不公平。 - 因此论文改为用**真实训练 FLOPs** 对齐非循环基线,作者认为这更适合工业级预训练比较。 这条讨论把 layer-loop 描述成同时兼顾**性能**和**工程友好性**的方案。
所属事件:Loopie循环Transformer发布,同算力击败30B基线(6 条相关)→
「研究」频道最新
- Matryoshka Hypencoder 让检索推理最高快 3.4 倍 — _reachsumit · 2026-07-21
- 新论文用股价估算 AI 对软件工程的生产率提升 — lihua_lei_stat · 2026-07-21
- 华为 RAMP 让用户特征缺失时广告预测更稳 — _reachsumit · 2026-07-21
- 论文发现搜索 agent 自蒸馏失效的关键是解码塌缩 — _reachsumit · 2026-07-21
- Google DeepMind 研究模型路由:不只看准确率,还看稳定性 — burkov · 2026-07-21
- ANNLib 提出模块化 C++ 框架,支持过滤与动态 ANN 检索 — _reachsumit · 2026-07-21