NeurIPS 2026 论文:稀疏层是 Looped 语言模型规模化的关键
burny_tech · x · 2026-09-27
USC 博士生 Ryan Lee 的首篇论文《Sparse Layers are Critical to Scaling Looped Language Models》被 NeurIPS 2026 接收,arXiv 摘要已公开。论文对比了标准 Transformer、MoE 模型与循环(looped)结构的组合,得到两个主要结论:
- Looped-MoE 优于标准基线:稠密的 looped 模型规模化表现不如标准 Transformer,但 Looped-MoE 更好。原因是各次循环经过同一共享层时会激活不同专家(routing divergence),在不增加参数的情况下恢复了表达能力。
- 循环边界是理想早退点:由于每次循环结尾正好是产出最终输出的层,looped 模型在循环边界的早退(early exit)带来比标准模型更优的算力-质量权衡。
作者总结:带早退的 Looped-MoE 模型不仅能在规模上胜过标准 Transformer,还能显著节省内存与推理成本、质量损失极小,是通向 compute-adaptive LM 的一步。
「模型」频道最新
- 网友用 Opus 5.5 配 Midjourney 跑创意需求,马斯克直呼 Wow — tetsuoai · 2026-09-27
- 一次人设 prompt 微调让 ChatGPT 提哥布林多近 4000%,OpenAI 上线后才发现 — victor_explore · 2026-09-27
- GPT-6 Astra 操控机械臂画金门大桥,OSWorld2.0 得分 72.6% — APPSO · 2026-09-27
- 小米 MiMo-V2.6 疑似将发 5 款模型,可见的有 1T、311B 和 9B — jacek2023 · 2026-09-27
- antirez:好程序员用 GPT 6 Astra 不见效,因为技能集变了 — antirez · 2026-09-27
- Opus 5.5 与 GPT-6 相隔 101 分钟发布,双雄开启降价战 — airesearch12 · 2026-09-27