Local LLM Hardware Dilemma: M1 Max 64GB vs M3 Max 128GB vs 24GB GPU Build

Guilty-Support-584 · reddit · 2026-09-16

A Reddit user running Qwen3.6 35B A3B locally on an M2 Max 32GB hits severe bottlenecks—4-10 tks via SSD streaming and 20-60 minutes prompt processing for 40-60k tokens. They weigh a €1500 used M1 Max 64GB, €3500 M3 Max 128GB, or a DIY 24GB GPU + 128GB RAM build.

Original post →

More from Infra

Infra channel →