专题 · FULL STORY

Meta开源Muse Glimmer:端侧多模态智能体新标杆

Meta发布300亿参数开源多模态模型Muse Glimmer,专为消费级硬件上的本地智能体优化。模型发布后迅速获得llama.cpp支持,实测展现极高推理效率与低算力消耗。

2026-08-10 ~ 2026-08-12 · 8 集 · 139 条

第 1 集 · Meta开源30B模型Muse Glimmer,主打本地智能体(2026-08-10,108 条)

Meta超级智能实验室发布了300亿参数的开源多模态模型Muse Glimmer,专为在消费级硬件上运行本地常驻智能体工作流优化。该模型采用Apache 2.0许可证,支持128K+上下文。开发者实测表明,该模型不仅能在极低资源下高效运行,还展现出自主部署、环境适配与长程工具调用等能力,被视为AI从被动生成向主动执行系统任务转变的重要信号。

已确认

  • 模型发布与生态支持:Meta发布30B参数稠密多模态模型Muse Glimmer,采用类似Gemma的密集架构与GQA技术。Hugging Face和UnslothAI提供了零日支持,Unsloth已上传GGUF量化版本并提供本地部署指南。此外,Meta还预告了最新基础模型Muse Spark 1.2的权重即将发布。
  • 自主部署与系统优化:开发者benburtenshaw实测,赋予模型工具调用能力后,它成功完成自我量化,并部署到受保护的Hugging Face Inference Endpoint,自动完成健康检查和聊天补全验证;进阶测试中,模型还针对H100架构自主优化了部署配置。
  • 低资源工具调用:UnslothAI展示通过2-bit GGUF量化,模型在仅消耗14GB RAM的条件下,成功连续调用100多个工具。
  • 本地运行与体验入口:开发者MaziyarPanahi实测在Mac Studio上本地运行,API速度约30 tok/s;benburtenshaw已在Hugging Face Hub搭建研究智能体入口。
  • 性能与基准:在24项基准测试中,Muse Glimmer在12项取得最佳成绩,整体优于Gemma4-31B和Qwen3.6-27B(据kimmonismus)。ForsookComparison实测认为其思维链效率极高,部分场景下超越同尺寸热门模型。
  • 硬件需求与量化:官方称仅需24GB显存即可运行(m16),danielhanchen转发称18GB显存可运行;开发者coder543在RTX 3090上使用Q4KXL量化、DFlash和mmproj支持256k上下文,显存占用约22GB;ydnar分享了RTX 3090上的优化配置。
  • 编码与推理速度:Ok-Shower7286实测在结合DFlash和llama.cpp时,本地编程任务跑出280 t/s极速;curiousily在M5 Pro上使用Q4量化版本,占用约20GB内存,生成速度约17 token/s。

尚未确认

  • 关于模型在24GB显存下能否完整支持256k上下文,coder543的测试显示可行,但不同量化配置下的具体表现可能有所差异。
  • 关于模型与Qwen等竞品的相对能力,curiousily认为其编码能力不及Qwen,但kimmonismus引用的基准测试显示优于Qwen3.6-27B,存在分歧。

为什么重要

  • 这些测试直观展示了AI模型从被动生成文本向主动执行复杂系统任务的转变。模型能够自主完成部署、环境适配与硬件优化,为未来AI自动化运维提供了极具价值的参考。
  • 低至14GB内存即可运行百次工具调用的特性,大幅降低了端侧复杂智能体的硬件门槛,使本地常驻智能体成为可能。
  • 扎克伯格发文重申了Meta对开源AI的坚定承诺,呼吁允许无限制的模型蒸馏。eyishazyer指出,这体现了Meta兼顾商业变现与开源生态的新策略:保持闭源旗舰模型专有,同时开源由其蒸馏而来的压缩版本。

还有 88 条相关讨论 →

第 2 集 · Meta将开源30B模型Muse Glimmer,跑分登顶开源榜(2026-08-10,6 条)

多方爆料及测试数据显示,Meta 即将发布代号 Muse Glimmer 的新开源大模型。该模型拥有 300 亿(30B)参数,采用 Apache 2.0 协议,其配置文件与跑分数据已在 Hugging Face 及 Artificial Analysis 曝光。这标志着 Meta 在 Llama 系列之后重新发力开放权重模型生态。

已确认

  • 模型参数与协议:根据 Artificial Analysis 的测试页面及 Hugging Face 泄露的配置文件,Muse Glimmer 拥有 300 亿(30B)参数,采用 Apache 2.0 开源协议。
  • 性能表现:跑分数据显示该模型(Muse Glimmer high)在性能表上表现优异,登顶开源榜单。
  • 后续规划:除了 Muse Glimmer,社区消息指出 Meta 还计划开源 Muse Spark 1.2 模型。据 @haider1 转述的爆料,Muse Spark 1.2 在基准测试中已能与 GPT-5.6 Terra 和 Opus 4.8 匹敌,且 API 成本仅为 Terra 的三分之一。

尚未确认

  • 架构细节:有爆料称该模型使用了 Muse Spark 的知识蒸馏,整体架构类似 Gemma 4(即 Llama 3 架构的衍生),但此信息仅停留在传闻阶段。

为什么重要

  • 重塑开源格局:据早期测试者反馈,虽然该模型尚未触及中国厂商发布的开源模型天花板,也落后于闭源前沿模型,但它已经是过去一年里全球发布的最强非中国开源模型。评论认为,这将是自 Llama 3 和 Llama 4 以来,Meta 开源生态中发布的最大规模开放权重模型,有望夺回非中国开源最强的位置。

第 3 集 · 疑似30B至400B参数新模型架构曝光引热议(2026-08-10,2 条)

近期开发者社区热议两款疑似曝光的新模型架构。一款推测为总参数约400B、激活参数15B的混合专家模型,其激进的GQA设计备受关注;另一款则是配有独立视觉编码器的约30B参数稠密多模态模型。开发者对这两款模型的架构细节及未来实验潜力表达了高度期待。

第 4 集 · llama.cpp首发支持Meta新模型Muse Glimmer(2026-08-10,2 条)

开源推理框架 llama.cpp 宣布对 Meta 最新开源的 Muse Glimmer 模型实现 Day-0(首发日)级别支持。这意味着开发者可以在模型发布的第一时间,直接利用 llama.cpp 框架进行推理部署。同时,Meta 官方也同步提供了 GGUF 量化版本,进一步降低了开发者的上手与使用门槛。

第 5 集 · Meta开源Muse Glimmer 30B:端侧智能体实测惊艳(2026-08-11,14 条)

Meta最新开源的Muse Glimmer 30B模型在发布后迅速引发开发者社区的密集实测。该模型专为智能体场景(多轮对话、工具调用)优化,实测显示其在代码处理、视觉定位等任务上表现严谨,且能在消费级硬件甚至浏览器中实现高速推理,证明了其作为端侧模型的巨大潜力。

已确认

  • 智能体与代码能力:博主@altryne确认该模型在包含约20个工具和大量上下文的复杂智能体场景中表现良好。开发者@pbaylies的行为审计显示,在处理工作代码时,该模型在12次测试中0次凭空捏造缺陷,而基线模型出现了10次。
  • 视觉与UI定位能力:多名开发者在Mac Studio上验证了其多模态精度。博主@MaziyarPanahi实测模型成功找出了合成医疗表单中的全部10个复选框并输出准确坐标,在调度UI测试中提取元素的平均交并比(IoU)高达0.988。此外,模型能在18.8秒内成功识别并定位推荐表单的必填项缺失,自动挂起工作流转交人工。
  • 跨硬件本地推理性能:该模型在多种设备上展现了优异的兼容性与速度。在Mac Studio的Chrome浏览器中通过WebGPU加载,生成速度可达约32 tokens/s;在M4 Max芯片的浏览器中速度约为25 tokens/s,开发者@xenovatech与@nicodotdev指出这与原生运行llama.cpp的速度相当。在独立显卡方面,博主@DanC403在入门级AMD RX 7600 XT (16GB)上结合投机解码实现了20 t/s;开发者@curiousily在M5 Pro设备上使用约24GB内存达到了22 t/s;博主@altryne也在RTX 5090上成功运行了GGUF量化版。

为什么重要

Muse Glimmer 30B的开源为本地端侧AI应用提供了一个兼具复杂逻辑处理(多工具调用)和高精度多模态感知(精准视觉坐标定位)的可行方案。其无需高昂算力成本即可在消费级硬件甚至纯浏览器环境中流畅运行的特性,大幅降低了医疗、自动化表单处理等隐私敏感场景的本地化部署门槛。

第 6 集 · Muse Glimmer模型实测:以极低算力逼近Qwen表现(2026-08-11,2 条)

近期用户对 Muse Glimmer 模型进行了多项实测,并将其与 Qwen 模型展开对比。测试反馈表明,Glimmer 在架构效率上取得了显著进步,仅需 Qwen 3.6 27B 模型约三分之一的算力(或更少的 Token 消耗),就能达到前者约 92% 的智能水平。尽管其综合智能程度略逊于 Qwen,但该模型在执行相同任务时展现出了极高的资源利用效率。

第 7 集 · Meta发布开源本地大模型与OpenAI无限制安全模型(2026-08-12,2 条)

AI 行业近期呈现出两条截然不同的发展路线:Meta 发布了 300 亿参数的 Muse Glimmer 模型,采用 Apache 2.0 协议,可在单张 24GB 显存的消费级 GPU 上本地运行;同日,OpenAI 扩展了 Daybreak 项目,面向经过验证的安全研究人员移除标准护栏,推出了解答率达 95% 的无限制网络安全模型。

第 8 集 · 单张GH200跑出3323 tok/s极限推理(2026-08-12,3 条)

近日开发者在单张 NVIDIA GH200 显卡上部署 Muse Glimmer 30B 模型,成功实现了高达 3323 tokens/s 的极限推理速度。该测试主要借助 vLLM 框架、BF16 精度、FlashAttention 3 以及 DFlash 等技术完成,充分展现了 GH200 在大模型推理上的卓越性能。目前该模型的 API 已开放实测,引发社区对单卡极限算力的广泛关注。