NeurIPS 2026 论文:稀疏层是 Looped 语言模型规模化的关键

burny_tech · x · 2026-09-27

USC 博士生 Ryan Lee 的首篇论文《Sparse Layers are Critical to Scaling Looped Language Models》被 NeurIPS 2026 接收,arXiv 摘要已公开。论文对比了标准 Transformer、MoE 模型与循环(looped)结构的组合,得到两个主要结论:

作者总结:带早退的 Looped-MoE 模型不仅能在规模上胜过标准 Transformer,还能显著节省内存与推理成本、质量损失极小,是通向 compute-adaptive LM 的一步。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →