M4 Max 浏览器跑 30B 模型达 25 tok/s,自定义 WebGPU 内核立功
xenovatech · reddit · 2026-08-12
开发者成功在搭载 M4 Max 芯片的 Mac 上,于浏览器中本地运行了 Muse Glimmer 30B 模型。通过使用自定义的 WebGPU 内核,该模型的运行速度达到了约 25 tokens/秒,这一表现已经与使用原生 llama.cpp 框架的运行速度相当。这展示了 WebGPU 在端侧大模型推理上的巨大潜力。
所属事件:M4 Max芯片跑30B模型达25 tok/s,WebGPU立功(2 条相关)→
「Infra」频道最新
- Phosphene 大版本更新:Mac 跑 MiniMax H3 内存大降,10秒直出 — cocktailpeanut · 2026-08-12
- Phosphene 3.7.0 深度解析:H3 解码提速与 48G Mac 量化方案 — cocktailpeanut · 2026-08-12
- 图解大模型推理:Prefill 与 Decode 两阶段如何影响速度 — techNmak · 2026-08-12
- RX 7600 XT 16GB 本地跑 30B 模型实测:结合投机解码达 20 t/s — DanC403 · 2026-08-12
- vLLM 首发 Day-0 支持 NVIDIA Nemotron 3.5 Lightning — AccBalanced · 2026-08-12
- Bittensor 推理网络实测:自建多供应商路由,Engy 稳定性夺冠 — markjeffrey · 2026-08-12