LOOM 让循环 MoE 稳定跑到 9-12 层循环,iso-FLOP 反超标准 MoE
SonglinYang4 · x · 2026-10-05
循环(looped)MoE 正成为主流——据报道 GPT-6 就采用该架构,但社区普遍怀疑它在同等 FLOPs 下能否胜过标准 MoE,因为收益随循环加深迅速饱和,开源方案通常止步于 2 次循环。
新研究 LOOM 提出统一配方,突破两大障碍:
- 深度诅咒:通过稳定隐藏状态让信息跨循环保留
- 专家选择坍缩:通过多样化专家计算保持路由多样性
在 1 亿至 17 亿参数模型上,LOOM 可稳定训练 9–12 次循环;在 iso-FLOP 条件下,700M 模型达到(被截断的)性能超越结果。这回应了「循环 MoE 能否在同等算力下用更深循环击败非循环版本」的核心问题。
所属事件:LOOM 让循环 MoE 稳定扩展至 9-12 层循环(2 条相关)→
「研究」频道最新
- Neural SDE 直接学物理时间动态,天气预报可提前 5 天出概率预测 — canaesseth · 2026-10-05
- 开发者开源欧洲语言 PII 脱敏模型,附训练与服务优化全记录 — auto_grad_ · 2026-10-05
- Meta 发布 NAVA-WAM:纯视频预训练机器人动作策略,摆脱动作标注依赖 — meta · 2026-10-05
- 开源 Rust 引擎 gamfit:一条公式拟合 GAM,自动选平滑参数 — Sauers_ · 2026-10-05
- Llama 3.1 8B 微调医疗决策模型:逐字段准确率 84%,全对仅 30% — Forsaken_Cut8542 · 2026-10-05
- 上海交大发布 LIFT:VLA 零力标注预训练,后训练注入力觉高频反应 — jiqizhixin · 2026-10-05