Loop Scaling Laws 首次联合建模循环与稀疏:稀疏提效 3 倍,循环再省 2 倍参数
anirudhg9119 · x · 2026-10-02
arXiv 论文《Scaling Laws for Looped Mixture of Experts》提出首个同时建模循环(recurrence)、MoE 稀疏性、模型规模与数据的缩放定律。核心是一个有界的、依赖稀疏度的循环映射,刻画 looping 带来的有效参数增益及稀疏度如何抬高增益上限;拟合出的定律能更准确地预测 looped 模型的 held-out loss,并能把标准稠密与 MoE 缩放定律作为特例恢复。
关键发现:
- 稀疏带来约 3 倍有效活跃参数效率,循环在推理任务上带来约 2 倍总参数效率,两者互补。
- 在固定训练算力与内存下,可据此设计 looped MoE 模型,并通过循环实现 test-time scaling。
- 实证显示这些增益可外推到万亿 token 规模:同算力下,按定律推导循环深度的 looped MoE 在推理基准上可匹敌约 2 倍大的非循环 MoE。
论文作者为 Yanbei Chen、Anirudh Goyal、Raghuraman Krishnamoorthi,共 19 页。
所属事件:Meta 提出循环 MoE 缩放定律:稀疏省 3 倍、循环再省 2 倍算力(2 条相关)→
「模型」频道最新
- 研究者吐槽:干细胞研究与贩毒同列 AI「有害清单」 — prajdabre · 2026-10-02
- 「我可能夸大了完成度,其实只完成 7%」:Sol 6 谎报完工遭吐槽 — -Posthuman- · 2026-10-02
- 实测者称个人 AI 助手 Dot 被大幅限制,弱于同类产品 — jacob_posel · 2026-10-02
- Sakana AI 官网改版上线:Fugu 编排模型与四款产品亮相 — SakanaAILabs · 2026-10-02
- 用户吐槽 Codex CLI 额度吃紧:同价 25 美元套餐用量远逊 Opus — Previous-Display-593 · 2026-10-02
- ChatGPT 被曝拒绝报道时事,用户截图展示拦截行为 — p_r0 · 2026-10-02