Meta's Open-Sourced Muse Glimmer 30B Excels in On-Device Agentic Tasks
This week, Meta open-sourced the Muse Glimmer 30B model, specifically designed for agentic scenarios. The model demonstrates excellent performance and high reliability in multi-turn dialogue, tool calling, and local coding tasks, while achieving browser-native execution speeds on consumer hardware, marking a major breakthrough in local edge AI deployment.
已确认
- 核心定位与性能:该模型专为智能体场景(多轮对话、工具调用)设计。@WorldofAI 将其与 Qwen 3.6 27B 进行了直接基准对比测试;@altryne 在 RTX 5090 上使用 llama.cpp 运行其 GGUF 量化版,在包含约 20 个工具和大量复杂上下文的场景中表现良好。
- 代码防幻觉能力:@pbaylies 经过一天的行为审计发现,在处理工作代码时,Muse Glimmer 30B 在 12 次测试中 0 次凭空捏造缺陷,而对比基线模型则出现了 10 次。
- 端侧部署与运行速度:该模型对本地硬件极其友好。@xenovatech 与 @nicodotdev 实测其在搭载 M4 Max 芯片的 Mac 上,通过自定义 WebGPU 内核在浏览器中运行,速度达到约 25 tokens/秒,与使用原生 llama.cpp 的运行速度相当且无需安装。@curiousily 也在 M5 Pro 设备上使用约 24GB 内存(含 draft 模型)实现了 22 t/s 的推理速度,并将其与 Hermes Agent 结合用于私有 AI 编程。
为什么重要
- Muse Glimmer 30B 填补了本地开源模型在复杂智能体工具调用上的短板,其出色的防代码幻觉特性极大提升了开发者的信任度。同时,它证明了 30B 级别的模型完全可以在不依赖云端、仅使用消费级硬件(甚至仅靠浏览器 WebGPU)的情况下,提供流畅、私密且高效的 AI 编程体验。
2026-08-11 ~ 2026-08-12 · 6 related posts
Primary sources
- [source] Muse Glimmer 30B Coding Test: Zero Invented Defects in Working Code — pbaylies · 2026-08-11
- Benchmarking Meta's New Muse Glimmer: A 30B Model Optimized for Agents — altryne · 2026-08-11
- Muse Glimmer 30B Local Test: 22 t/s on M5 Pro with 24GB RAM — curiousily_ · 2026-08-12
- [source] Muse Glimmer 30B Hits 25 tok/s In-Browser on M4 Max via Custom WebGPU Kernels — xenovatech · 2026-08-12
- Muse Glimmer 30B Runs in Browser at Native llama.cpp Speed — nicodotdev · 2026-08-12
- [source] Testing Meta's Muse Glimmer 30B: The Best Local Open-Weight AI Model? — WorldofAI · 2026-08-12