ByteDance 提出计算匹配 MoE 循环 Transformer 缩放定律
ByteDance-Seed · hf · 2026-09-02
ByteDance 发布研究 SMELT,探讨了在计算量、参数量和缓存预算匹配的情况下,通过循环稀疏混合专家模型的中间层来提升训练效率和下游性能。该方法在保持 FLOPs 不变的前提下优化了架构表现。
「研究」频道最新
- 《神经科学趋势》:探讨笑的神经生物学基础 — burny_tech · 2026-09-02
- 渗透理论:从网络结构到机器学习的相变应用 — burny_tech · 2026-09-02
- 寻找参数空间:微小突变诱发多样化行为的区域 — ctjlewis · 2026-09-02
- 自愿给 AAAI 审稿却无回报,研究者自嘲后觉得仍值 — OptimalOptimizer · 2026-09-02
- 逆向数学揭示:为何证明计算难题如此之难 — burny_tech · 2026-09-02
- 新研究揭示扩散模型泛化与记忆的相变边界 — burny_tech · 2026-09-02