Looped Transformer Debate Revives Years-Old Sparse Universal Transformer Work

Amid renewed discussion of looped transformers and per-token adaptive computation, Yikang Shen points out that his earlier Sparse Universal Transformer paper already explored this idea, using SMoE to make shared-parameter transformers scalable.

2026-09-04 ~ 2026-09-04 · 2 related posts