Looped transformer debate revisited: Sparse Universal Transformer (EMNLP 2023) got there first

Yikang_Shen · x · 2026-09-04

Researcher Yikang Shen points out that today's looped-transformer and per-token adaptive-computation discussions echo the Sparse Universal Transformer (EMNLP 2023). SUT builds on Universal Transformer's parameter sharing, uses Sparse MoE to cut compute/memory costs, and shows stronger compositional generalization on formal-language tasks (logical inference, CFQ) while staying efficient on WMT'14.

Related event: Looped Transformer Debate Revives Years-Old Sparse Universal Transformer Work(2 posts)→

Original post →

More from Research

Research channel →