Loopie循环式Transformer发布,以极低成本追平大模型

Zitian Gao团队发布了名为Loopie的循环式Transformer系列模型,旨在通过重复执行网络层来同时提升参数效率与算力效率。该系列包含20B总参(2B激活)和6B总参(0.6B激活)两个MoE版本。该研究备受关注的原因在于,它不仅克服了循环式架构过往难以扩展的痛点,更宣称在极低的计算成本下达到了大参数模型的性能。

关键细节与突破

过去循环式Transformer在增加预训练计算量时,效果往往不如直接放大参数量。第一作者Zitian Gao表示,团队投入了数亿美元算力去验证经典的Universal Transformer路线(即model-loop方案),发现其难以扩展到上十亿参数的大规模MoE架构。到了预训练后期,团队提出的Layer-loop方案(即Loopie模型)展现出了更卓越的扩展性,成功克服了以往的瓶颈。据@Dany0估计,此类训练的成本可能仅在几十万到十几万美元级别。

性能表现与评估争议

在性能方面,论文声称20B模型在相同训练墙钟时间与匹配的推理算力预算下,击败了同算力的30B基线模型;更引人注目的是,@Dany0指出该模型仅用10%的预训练token,性能就能匹配甚至超过Qwen3 Coder 30B。针对该研究,@teortaxesTex提醒业界,评估循环式Transformer不能仅仅看参数量。由于重复执行层会放大计算开销,必须在相同的预训练预算和实际训练成本下进行对比才具有参考价值。

2026-07-20 ~ 2026-07-21 · 7 条相关

一手来源