环状 Transformer 讨论再起:三年前的 Sparse Universal Transformer 已试过
Yikang_Shen · x · 2026-09-04
研究者沈益康(Yikang Shen)指出,当下关于 looped transformer 与逐 token 自适应计算的讨论,其实对应他们几年前提出的 Sparse Universal Transformer(SUT)。该论文(EMNLP 2023)基于 Universal Transformer 的层间参数共享思路,用 Sparse MoE 降低其计算与内存开销,在形式语言任务(逻辑推理、CFQ)上保持更好的组合泛化,同时在 WMT'14 等标准任务上兼顾参数与计算效率。
所属事件:环状 Transformer 讨论再起,Sparse Universal Transformer 早有探索(2 条相关)→
「研究」频道最新
- 开源项目 Marin 启动 535B/A23B MoE 训练,一年内从 1 人扩到 10 人 — wandb · 2026-09-04
- 研究称让 AI 造 App 的环境成本可达快速提问的 1 万倍 — shiringhaffary · 2026-09-04
- SpeedrunBench:首个测 AI 智能体速通游戏能力的基准,最优模型距人类纪录差 4 倍 — mariyaivasileva · 2026-09-04
- Foresight 推出新 RFP:最高 10 万美元资助开源 AI 科学与安全项目 — niloofar_mire · 2026-09-04
- 研究者用 Lean4 机器验证解决 Chrisnata et al 开放问题 — _xjdr · 2026-09-04
- NeurIPS 悉尼几秒内门票售罄,距录用放榜还有三周 — alrojo · 2026-09-04