LOOM 破解循环 MoE 扩展难题:700M 模型 5 循环困惑度降至 16.54
Intelligent-Systems · hf · 2026-10-05
Looped Transformer 通过重复共享权重块增加有效深度而不增参数,但在 FLOPs 匹配比较下,循环对大型 MoE 的收益不明,以往通常只用两次循环。该工作诊断出两大障碍并提出 LOOM。
- 障碍一:循环继承并放大“深度诅咒”,残差更新累积导致隐状态方差随迭代增长,深层递归不稳定、表征漂移。
- 障碍二:专家选择坍缩,router 在各循环反复选同一批专家,额外迭代只增算力不增计算多样性。
- LOOM 通过缩放残差更新控制方差、每循环重注入输入嵌入稳定递归;用 per-loop router 激活不同专家并引入 Looping Residual 携带早期输出,实现多样化。
- 实验覆盖 100M–1.7B 模型,稳定扩展到 9–12 循环:FLOPs 近匹配下 700M 模型在 5 循环最优,困惑度从 18.36 降至 16.54,零样本平均准确率 38.84%→39.53%;不匹配时 1.7B 模型在 60B token、9 循环下困惑度 9.62→7.77,准确率 42.4%→47.7%。代码开源。
「研究」频道最新
- Judea Pearl:逻辑与因果推断是西方科学两大支柱 — yudapearl · 2026-10-05
- 清华 NLP 推出 LexReward:三维分类体系驱动法律大模型奖励建模 — TsinghuaNLP · 2026-10-05
- 蛋白质折叠数据能让大模型更会推理:微调后 10 项基准全涨 — SJUT1 · 2026-10-05
- MotorMind:通用 VLM 免训练操控真机机器人,成功率 95% — UIUC-CS · 2026-10-05
- MBZUAI 发布 HyperBrowseComp:13 语种 423 题压测浏览 Agent — MBZUAI · 2026-10-05
- VaSE:免训练随机 KV 缓存驱逐法,缓解推理模型内存膨胀 — robinomial · 2026-10-05