Meta开源Muse Glimmer 30B:端侧智能体性能与防幻觉受好评
Meta本周最新开源了专为智能体场景设计的Muse Glimmer 30B模型。该模型在多轮对话、工具调用和本地编程任务中展现出优异的性能与极高的可靠性,且能在消费级硬件上实现浏览器原生级别的运行速度,被视为本地端侧AI部署的重要突破。
已确认
- 核心定位与性能:该模型专为智能体场景(多轮对话、工具调用)设计。@WorldofAI 将其与 Qwen 3.6 27B 进行了直接基准对比测试;@altryne 在 RTX 5090 上使用 llama.cpp 运行其 GGUF 量化版,在包含约 20 个工具和大量复杂上下文的场景中表现良好。
- 代码防幻觉能力:@pbaylies 经过一天的行为审计发现,在处理工作代码时,Muse Glimmer 30B 在 12 次测试中 0 次凭空捏造缺陷,而对比基线模型则出现了 10 次。
- 端侧部署与运行速度:该模型对本地硬件极其友好。@xenovatech 与 @nicodotdev 实测其在搭载 M4 Max 芯片的 Mac 上,通过自定义 WebGPU 内核在浏览器中运行,速度达到约 25 tokens/秒,与使用原生 llama.cpp 的运行速度相当且无需安装。@curiousily 也在 M5 Pro 设备上使用约 24GB 内存(含 draft 模型)实现了 22 t/s 的推理速度,并将其与 Hermes Agent 结合用于私有 AI 编程。
为什么重要
- Muse Glimmer 30B 填补了本地开源模型在复杂智能体工具调用上的短板,其出色的防代码幻觉特性极大提升了开发者的信任度。同时,它证明了 30B 级别的模型完全可以在不依赖云端、仅使用消费级硬件(甚至仅靠浏览器 WebGPU)的情况下,提供流畅、私密且高效的 AI 编程体验。
2026-08-11 ~ 2026-08-12 · 6 条相关
一手来源
- 实测 Meta 新开源模型 Muse Glimmer 30B — WorldofAI ·
- M4 Max 浏览器跑 30B 模型达 25 tok/s,自定义 WebGPU 内核立功 — xenovatech ·
- Muse Glimmer 30B 编码实测:零次凭空捏造代码缺陷 — pbaylies ·
- 【源头】Muse Glimmer 30B 编码实测:零次凭空捏造代码缺陷 — pbaylies · 2026-08-11
- 实测Meta新模型Muse Glimmer:30B专为智能体优化 — altryne · 2026-08-11
- 实测 Muse Glimmer 30B 本地部署:24GB 显存跑 22 t/s — curiousily_ · 2026-08-12
- 【源头】M4 Max 浏览器跑 30B 模型达 25 tok/s,自定义 WebGPU 内核立功 — xenovatech · 2026-08-12
- Muse Glimmer 30B模型实现浏览器原生级推理速度 — nicodotdev · 2026-08-12
- 【源头】实测 Meta 新开源模型 Muse Glimmer 30B — WorldofAI · 2026-08-12