ByteDance 提出计算匹配 MoE 循环 Transformer 缩放定律

ByteDance-Seed · hf · 2026-09-02

ByteDance 发布研究 SMELT,探讨了在计算量、参数量和缓存预算匹配的情况下,通过循环稀疏混合专家模型的中间层来提升训练效率和下游性能。该方法在保持 FLOPs 不变的前提下优化了架构表现。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →