Meta 首个 Loop MoE Scaling Law:稀疏省 3 倍、循环省 2 倍算力

facebook · hf · 2026-10-01

Meta 提出 Loop Scaling Laws,首个同时建模「循环(recurrence)」与「稀疏(MoE)」两条效率路线的 scaling law:用有界、随稀疏度条件变化的循环映射刻画 looping 带来的有效参数增益及稀疏度如何放大该增益。该定律对 looped 模型 held-out loss 的预测优于既有方法,且能把标准 dense 与 MoE scaling law 作为特例恢复。实测显示:稀疏带来约 3 倍有效参数效率,循环在推理任务上带来约 2 倍总参数效率;在万亿 token 规模下,等训练算力时按定律设计的 looped MoE 可匹敌约 2 倍大的非 looped MoE,并支持通过循环做测试时扩展。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →