清华字节SMELT论文:层循环两次,省算力6.8%-18%

机器之心 · wechat · 2026-09-08

清华大学与字节跳动 Seed 等机构的论文 SMELT 首次在严格对齐算力、参数量和 KV cache 的条件下,公平评估了 Looped Transformer(重复执行部分层)的真实收益,回答了「收益来自架构还是多花算力」的争议。

论文给出的最优配方是:将中间约 50% 的层循环执行两次,并采用比常规模型更大的执行深宽比。在 100M 到 1.6B 激活参数(最大总参 54B)共 16 组匹配配置上,SMELT 全部取得更低验证损失;按 Chinchilla 式 Scaling Law 拟合,达到相同 loss 可节省 6.8%–18.0% 的训练算力,且预算越大节省越多。下游任务上,SMELT 在 96 组配置中的 83 组 DCLM 分数更高,且相同验证损失下仍优于基线,代码、长文本和依赖 in-context 示例的任务收益最大。

机制分析显示,第二次执行复用部分专家、对残差流做更大幅度修正,注意力位置与第一次高度重合(Q/K 余弦相似度 0.89–0.93)但读取内容不同;在 Dyck 语言任务中第二次执行把注意力从 BOS 转向答案位置,attention sink 反而减弱。局限在于消融规模有限、未涉及实际运行时效率。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →