LOOM 让循环 MoE 稳定跑到 9-12 层循环,iso-FLOP 反超标准 MoE

SonglinYang4 · x · 2026-10-05

循环(looped)MoE 正成为主流——据报道 GPT-6 就采用该架构,但社区普遍怀疑它在同等 FLOPs 下能否胜过标准 MoE,因为收益随循环加深迅速饱和,开源方案通常止步于 2 次循环。

新研究 LOOM 提出统一配方,突破两大障碍:

在 1 亿至 17 亿参数模型上,LOOM 可稳定训练 9–12 次循环;在 iso-FLOP 条件下,700M 模型达到(被截断的)性能超越结果。这回应了「循环 MoE 能否在同等算力下用更深循环击败非循环版本」的核心问题。

所属事件:LOOM 让循环 MoE 稳定扩展至 9-12 层循环(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →