M4 Max 浏览器跑 30B 模型达 25 tok/s,自定义 WebGPU 内核立功

xenovatech · reddit · 2026-08-12

开发者成功在搭载 M4 Max 芯片的 Mac 上,于浏览器中本地运行了 Muse Glimmer 30B 模型。通过使用自定义的 WebGPU 内核,该模型的运行速度达到了约 25 tokens/秒,这一表现已经与使用原生 llama.cpp 框架的运行速度相当。这展示了 WebGPU 在端侧大模型推理上的巨大潜力。

所属事件:M4 Max芯片跑30B模型达25 tok/s,WebGPU立功(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →