Maglev: Sliding Recurrent Memory improves long-context efficiency

UTEXAS · hf · 2026-08-15

UTEXAS introduced Maglev, a recurrent Transformer architecture with a fixed-size memory. By utilizing coupled prefiller-decoder training, the method improves long-context modeling performance while enabling efficient parallel training and reducing inference costs.

Original post →

More from Research

Research channel →