字节跳动等发布SMELT:MoE循环Transformer省近两成算力
清华大学、ByteDance Seed 与 TokenWave 联合发布论文 SMELT,提出一种稀疏混合专家循环 Transformer 架构:在保持参数量和缓存预算不变的前提下,将模型中间一半的层循环运行两次。研究建立了计算匹配的缩放定律,实验通过控制 FLOPs 的对照测试显示,该方法可节省 6.8%-18% 的训练算力,同时提升训练效率和下游任务性能。有讨论认为该思路可能被 GPT-6 等未来大模型采用。
2026-09-02 ~ 2026-09-03 · 4 条相关
- ByteDance 提出计算匹配 MoE 循环 Transformer 缩放定律 — ByteDance-Seed · 2026-09-02
- SMELT 论文:中层层循环两次,MoE 训练省 6.8-18% FLOPs — iScienceLuvr · 2026-09-02
- SMELT 论文:循环 Transformer 省 6.8-18% 训练算力,GPT-6 或采用 — mark_k · 2026-09-03
另有 1 条近重复转述:scaling01