looped MoE 新配置:2 倍专家、0.5 倍循环层、2 倍循环并解绑注意力

burny_tech · x · 2026-09-30

研究者 rosinality 提出一种更高效的 looped MoE 配置:专家数翻倍(2x experts)、循环层数减半(0.5x looped layers)、循环次数翻倍(2x loops),并解绑注意力(attention untying)。

其核心观点是:经过这一调整,looped transformer 的问题从「归纳偏置」转向了「如何更好地分配计算资源」,即架构设计问题被重新定义为资源分配问题。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →