M4 Max Runs 30B Model at 25 tok/s in Browser via WebGPU
Developers have successfully run the Muse Glimmer 30B model locally in a browser on an M4 Max Mac. Using custom WebGPU kernels, the model achieved an impressive inference speed of about 25 tokens per second.
2026-08-12 ~ 2026-08-12 · 2 related posts
- Muse Glimmer 30B Hits 25 tok/s In-Browser on M4 Max via Custom WebGPU Kernels — xenovatech · 2026-08-12
- Muse Glimmer 30B Runs in Browser at Native llama.cpp Speed — nicodotdev · 2026-08-12