字节跳动等发布SMELT:MoE循环Transformer省近两成算力

清华大学、ByteDance Seed 与 TokenWave 联合发布论文 SMELT,提出一种稀疏混合专家循环 Transformer 架构:在保持参数量和缓存预算不变的前提下,将模型中间一半的层循环运行两次。研究建立了计算匹配的缩放定律,实验通过控制 FLOPs 的对照测试显示,该方法可节省 6.8%-18% 的训练算力,同时提升训练效率和下游任务性能。有讨论认为该思路可能被 GPT-6 等未来大模型采用。

2026-09-02 ~ 2026-09-03 · 4 条相关

另有 1 条近重复转述:scaling01