Can four M5 Ultra Mac Studios serve 100 users for local LLM inference?

Interesting-Print366 · reddit · 2026-09-02

A team plans to run four M5 Ultra Mac Studios as inference-only servers for 100 users via Openclaw, considering Qwen3.5 27B or Qwen Next Flash class models. Realistic load is 30-40 concurrent users with occasional spikes to 80-90; discussion centers on throughput and model selection tradeoffs.

Related event: Can Four M5 Ultra Mac Studios Serve Inference for 100 Users?(2 posts)→

Original post →

More from Infra

Infra channel →