FreeToken Engine: Run 35B Models at 39.3 t/s on 8GB GPUs

rohanpaul_ai · x · 2026-08-29

Researchers from Berkeley and UT Austin released FreeToken, a new engine designed to efficiently run large open models on consumer hardware by optimizing expert caching.

Related event: FreeToken Lets 8GB GPUs Run 35B MoE Models On-Device(2 posts)→

Original post →

More from Infra

Infra channel →