SMELT 论文:MoE 循环 Transformer 在算力匹配下更优

scaling01 · x · 2026-09-02

arXiv 新论文《SMELT:计算匹配 MoE 循环 Transformer 的缩放定律》提出了一种新架构 SMELT(Sparse MoE Transformer, middle layers Loop Twice)。在严格匹配每 token FLOPs、非嵌入参数和 KV 缓存的情况下,SMELT 通过循环中间层两次,在计算最优前沿上节省了 6.8%--18.0% 的训练算力。其优势在代码任务和长上下文样本中尤为明显。

所属事件:字节跳动等发布SMELT:MoE循环Transformer省近两成算力(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →