Looped-DiT: Layer Reuse Beats Models 6.5x Larger with 4.9x Less Compute

A new paper from SenseTime, Tsinghua and NTU proposes Looped-DiT, which repeatedly reuses shared Transformer blocks within each denoising step. A 260M-parameter model beats one 6.5x larger while cutting inference compute by 4.9x.

2026-10-03 ~ 2026-10-04 · 2 related posts

1 near-duplicate retellings: burny_tech