Muse Glimmer 30B模型实现浏览器原生级推理速度

nicodotdev · x · 2026-08-12

Meta 发布的新模型 Muse Glimmer 30B 现已支持通过 WebGPU 在浏览器本地运行。实测显示,其在 M4 Max 处理器上能达到约 25 tok/s 的速度,与使用 llama.cpp 的原生运行速度相当,且无需安装任何额外软件。

所属事件:M4 Max芯片跑30B模型达25 tok/s,WebGPU立功(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →