SMELT 论文:中层层循环两次,MoE 训练省 6.8-18% FLOPs

iScienceLuvr · x · 2026-09-02

新论文 SMELT(Sparse MoE Transformer,middle layers Loop Twice)研究在 MoE Transformer 上做层循环(looping),同时严格匹配每 token FLOPs、非嵌入总参数量和 KV cache 三项预算。

核心做法是将中间一半的层循环两次,在三项预算上与不循环的基线持平。作者在四个规模(最高 54B 非嵌入参数)上扩展实验,并为每种架构拟合独立的 Chinchilla 式 scaling law。

结论:SMELT 的 loss 随算力下降更快,在 compute-optimal 前沿上可节省 6.8%–18.0% 的训练 FLOPs。

所属事件:字节跳动等发布SMELT:MoE循环Transformer省近两成算力(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →