Looped-DiT: Layer Reuse Beats Models 6.5x Larger with 4.9x Less Compute
A new paper from SenseTime, Tsinghua and NTU proposes Looped-DiT, which repeatedly reuses shared Transformer blocks within each denoising step. A 260M-parameter model beats one 6.5x larger while cutting inference compute by 4.9x.
2026-10-03 ~ 2026-10-04 · 2 related posts
- Looped-DiT: 260M Looped Model Beats 6.5x Larger Diffusion Models With 4.9x Less Compute — NandoDF · 2026-10-03
1 near-duplicate retellings: burny_tech