Running 20B MoE on Mac M4 with Only 500MB RAM at 40 TPS via SSD Streaming

netikas · reddit · 2026-08-10

The author explores extreme local LLM inference optimization on MacBook Air M4, focusing on minimizing memory footprint.

Original post →

More from Infra

Infra channel →