Foil 方法让循环 MoE 翻倍专家数,百B token 预训练损失降 0.012 nat
Shouren Wang · hf · 2026-10-06
- 核心问题:循环 Transformer(重复使用同一层块)与稀疏 MoE 是两种充分利用参数的设计哲学,Foil 提出如何把两者结合——怎么给 MoE「打循环」。
- 方法:在专家参数与每 token 专家计算量不变的前提下,(1)「压平专家」:专家层减半、每层专家数翻倍、循环次数翻倍,让每次路由从更大池子选专家;(2)「解绑注意力」:每轮循环拥有独立注意力参数,专家与路由保持共享。
- 结果:20B token 时所有 Foil 模型预训练损失均低于未压平基线;100B token 时损失随压平程度单调改善,压平最多者以相同参数和计算量比基线低 0.012 nat,下游准确率持平或更好;解绑注意力还带来更均衡、更自信的路由。
- 设计启示:循环与加宽专家层的收益相互放大;路由置信度比负载均衡更能反映健康的专家使用;稀疏循环 MoE 应使用更多每层专家和更多循环次数。
- 代码与配置已开源(GitHub: SR-A-W/how-to-loop-moe)。
「研究」频道最新
- World Labs 实习项目提出 LoGo 奖励,解决视频生成的局部瑕疵 — linoy_tsaban · 2026-10-06
- 视觉驱动机器人踢球:RL 让人形机器人仅靠机载视觉追球射门 — chris_j_paxton · 2026-10-06
- AIGENIE R 包教程:用 LLM 全自动生成并验证心理量表题池 — GolinoHudson · 2026-10-06
- AI 能一键解决的问题之外,数学 PhD 还剩什么题可做? — robleclerc · 2026-10-06
- PhAI Labs 把 LeCun 的 JEPA 扩成横跨物理到生物学的通用世界模型 — The Decoder · 2026-10-06
- 光子 AI 芯片可自校准:利用误差信号原位梯度下降,MSE 降至 0.0013 — bravo_abad · 2026-10-06