Sparse Universal Transformer:用 SMoE 让共享参数 Transformer 可扩展
Yikang_Shen · x · 2026-09-04
作者 Yikang Shen 在讨论「循环 transformer 与按 token 自适应计算」时指出这就是 Universal Transformer 思路,并分享其数年前的论文 Sparse Universal Transformer(EMNLP 2023,与 Shawn Tan、Aaron Courville、Chuang Gan 合著):
- UT 跨层共享参数、在特定假设下图灵完备,组合泛化优于普通 Transformer,参数效率更高,但因计算/内存开销大而难以扩展
- SUT 引入 Sparse Mixture of Experts(SMoE)降低 UT 的计算复杂度,同时保留参数效率与泛化能力
- 实验显示 SUT 在形式语言任务(逻辑推理、CFQ)泛化强,在 WMT'14 等标准基准上也有出色的参数与计算效率
所属事件:环状 Transformer 讨论再起,Sparse Universal Transformer 早有探索(2 条相关)→
「研究」频道最新
- 开源项目 Marin 启动 535B/A23B MoE 训练,一年内从 1 人扩到 10 人 — wandb · 2026-09-04
- 研究称让 AI 造 App 的环境成本可达快速提问的 1 万倍 — shiringhaffary · 2026-09-04
- SpeedrunBench:首个测 AI 智能体速通游戏能力的基准,最优模型距人类纪录差 4 倍 — mariyaivasileva · 2026-09-04
- Foresight 推出新 RFP:最高 10 万美元资助开源 AI 科学与安全项目 — niloofar_mire · 2026-09-04
- 研究者用 Lean4 机器验证解决 Chrisnata et al 开放问题 — _xjdr · 2026-09-04
- NeurIPS 悉尼几秒内门票售罄,距录用放榜还有三周 — alrojo · 2026-09-04