Sparse Universal Transformer: SMoE makes parameter-sharing transformers scalable (EMNLP 2023)

Yikang_Shen · x · 2026-09-04

In a discussion about looped transformers and adaptive per-token computation, Yikang Shen points out this is the Universal Transformer idea and shares his earlier paper, Sparse Universal Transformer (EMNLP 2023, with Shawn Tan, Aaron Courville, Chuang Gan):

Related event: Looped Transformer Debate Revives Years-Old Sparse Universal Transformer Work(2 posts)→

Original post →

More from Research

Research channel →