M4 Max芯片跑30B模型达25 tok/s,WebGPU立功
开发者成功在搭载M4 Max芯片的Mac设备上,通过浏览器本地运行了Meta发布的Muse Glimmer 30B模型。借助自定义的WebGPU内核技术,该模型在本地推理速度达到约25 tok/s,展现出媲美原生应用的流畅度。这一实测证明了现代硬件结合WebGPU在端侧运行大型模型方面的巨大潜力。
2026-08-12 ~ 2026-08-12 · 2 条相关
- M4 Max 浏览器跑 30B 模型达 25 tok/s,自定义 WebGPU 内核立功 — xenovatech · 2026-08-12
- Muse Glimmer 30B模型实现浏览器原生级推理速度 — nicodotdev · 2026-08-12