Loop Scaling Laws 首次联合建模循环与稀疏:稀疏提效 3 倍,循环再省 2 倍参数

anirudhg9119 · x · 2026-10-02

arXiv 论文《Scaling Laws for Looped Mixture of Experts》提出首个同时建模循环(recurrence)、MoE 稀疏性、模型规模与数据的缩放定律。核心是一个有界的、依赖稀疏度的循环映射,刻画 looping 带来的有效参数增益及稀疏度如何抬高增益上限;拟合出的定律能更准确地预测 looped 模型的 held-out loss,并能把标准稠密与 MoE 缩放定律作为特例恢复。

关键发现:

论文作者为 Yanbei Chen、Anirudh Goyal、Raghuraman Krishnamoorthi,共 19 页。

所属事件:Meta 提出循环 MoE 缩放定律:稀疏省 3 倍、循环再省 2 倍算力(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →