M4 Max Runs 30B Model at 25 tok/s in Browser via WebGPU

Developers have successfully run the Muse Glimmer 30B model locally in a browser on an M4 Max Mac. Using custom WebGPU kernels, the model achieved an impressive inference speed of about 25 tokens per second.

2026-08-12 ~ 2026-08-12 · 2 related posts