专题 · FULL STORY

Meta开源Muse Glimmer:从发布到单卡实测

Meta发布300亿参数开源多模态模型Muse Glimmer,主打本地智能体工作流。模型发布后迅速获得llama.cpp首发支持,开发者随即在消费级显卡上完成极限部署与推理实测,展现其低显存长上下文优势。

2026-08-10 ~ 2026-08-11 · 6 集 · 73 条

第 1 集 · Meta开源30B端侧智能体模型Muse Glimmer(2026-08-10,51 条)

Meta超级智能实验室正式发布开源多模态模型Muse Glimmer,这是一款30B参数的稠密视觉语言模型,专为在消费级硬件上运行本地常驻智能体工作流而优化。模型采用Apache 2.0协议开放权重,显著降低了高级智能体的端侧部署门槛。官方称其为同等规模下最强的智能体模型,在24项基准测试中有12项取得最佳成绩,整体优于Gemma4-31B和Qwen3.6-27B。

已确认

  • 模型规格:Muse Glimmer为30B参数的Dense架构(非MoE),由Muse蒸馏而来,配备ViT-G/14感知编码器。原生支持131K上下文、100多种语言以及文本与图像交织的多模态输入。
  • 硬件要求:该模型对本地部署非常友好,可完全在单张消费级GPU上运行。根据不同转述,其运行显存需求在18GB至24GB之间,支持4-bit量化,并能通过Ollama的MLX引擎在Mac等设备上本地运行。PyTorch官方也宣布ExecuTorch框架新增了对该模型的支持。
  • 性能表现:官方称其为同等规模下最强的智能体模型。在24项基准测试中有12项取得最佳成绩,整体表现优于Gemma4-31B和Qwen3.6-27B,其编码能力与同级别的Qwen 27B相当,并在关键智能体用例上表现优异。
  • 适用场景:针对复杂的多步骤任务进行优化,适合隐私敏感型应用,如编程、文档分析和个人助理。

尚未确认

  • Meta预告即将发布最新基础模型Muse Spark 1.2的开放权重版本,具体发布时间与详细参数暂未确定。

为什么重要

  • Muse Glimmer显著降低了本地部署高级智能体的硬件门槛,使得全天候常驻的个人智能体能在标准PC上流畅运行。此外,这种“闭源旗舰+开源蒸馏”的双线并行策略,也被视为兼顾商业变现与开源生态建设的新尝试。扎克伯格也发文重申了Meta对开源AI的坚定承诺,并呼吁允许无限制的模型蒸馏。

还有 31 条相关讨论 →

第 2 集 · Meta将开源30B参数Muse Glimmer及Muse Spark 1.2(2026-08-10,4 条)

据多方爆料,Meta即将重返开源权重模型领域,发布30B参数的稠密模型Muse Glimmer及Muse Spark 1.2。新模型架构融合Gemma 4与视觉能力,已在Hugging Face曝光。早期测试者反馈,该模型虽未触及中国厂商开源模型的天花板,但有望夺回非中国开源最强地位。

第 3 集 · Meta发布Muse Glimmer:实测展现自主部署与优化能力(2026-08-10,6 条)

Meta发布了专为本地智能体设计的300亿参数开源多模态模型Muse Glimmer。开发者实测表明,该模型不仅能自主完成部署与环境适配,还能在极低内存下保持长程工具调用能力,展现了极高的智能体自动化潜力。

已确认

  • 模型发布:Meta发布300亿参数开源多模态模型Muse Glimmer,专为本地智能体设计,Hugging Face提供了首日支持。
  • 自主部署与量化:开发者benburtenshaw实测,赋予模型工具调用能力后,它成功完成了自我量化操作,并将自身部署到受保护的Hugging Face Inference Endpoint,自动完成了健康状态检查和聊天补全验证。
  • 硬件优化:在进阶测试中,该模型成功针对H100架构,自主优化了其部署配置。
  • 低资源工具调用:UnslothAI展示了通过2-bit GGUF量化技术,该模型在仅消耗14GB RAM的条件下,成功实现了连续调用100多个工具的能力。
  • 体验入口:benburtenshaw已在Hugging Face Hub上搭建了研究智能体入口,方便其他开发者直接交互测试。

为什么重要

  • 这些测试直观展示了AI模型从被动生成文本向主动执行复杂系统任务的转变。模型能够自主完成部署、环境适配与硬件优化,为未来AI自动化运维提供了极具价值的参考。同时,低至14GB内存即可运行百次工具调用的特性,大幅降低了端侧复杂智能体的硬件门槛。

第 4 集 · 单卡极限跑Muse Glimmer等大模型:长上下文与高TPS实测(2026-08-10,8 条)

近期,开发者社区展示了在单张消费级显卡上极限部署和优化大语言模型的惊人结果,核心焦点在于通过DFlash、NVFP4及特定量化技术大幅提升推理速度并突破显存长上下文限制。

已确认

  • 高推理速度:多位开发者实测 Meta Muse Glimmer 30B 模型在单张 RTX 5090 显卡上具有极高的生成速度。@Scobleizer 报告平均速度达 208 tps,最高 274 tps;@NVIDIAAI 和 @BanghuaZ 指出在 SGLang 框架下开启 NVFP4 和 DFlash 优化,速度约为 230 tok/s。@tokenbender 和 @dejavucoder 则通过 tuned quants 和 dflash 技术,让该模型达到了 114 tokens/s 的推理速度,并认为优化后有望在 16G 显存中运行。
  • 长上下文极限:@coder543 在单张 RTX 3090(24GB)上使用 Q4KXL 量化、DFlash 及 mmproj,成功让 Muse Glimmer 30B 模型完整支持 256k 上下文,显存占用仅约 22GB。@ydnar 也分享了在 RTX 3090 上部署该模型的具体配置与显存权衡。此外,@Anbeeld 报告了一项更极端的测试:在单张 RTX 3090 上为占用约 17GB 显存的 Qwen 3.5 35B A3B 模型加载了近 100 万 token 的上下文。

为什么重要

  • 降低本地部署门槛:这些实测表明,结合最新的量化与底层优化技术,原本需要昂贵算力的高参数模型(如30B级别)及其超长上下文能力,已经能够浓缩进单张主流消费级显卡中流畅运行。这不仅极大降低了个人开发者的研究与应用门槛,也为大模型的本地化、隐私化部署提供了切实可行的路径。

第 5 集 · llama.cpp首发支持Meta新模型Muse Glimmer(2026-08-10,2 条)

开源推理框架 llama.cpp 宣布对 Meta 最新开源的 Muse Glimmer 模型实现 Day-0(首发日)级别支持。这意味着开发者可以在模型发布的第一时间,直接利用 llama.cpp 框架进行推理部署。同时,Meta 官方也同步提供了 GGUF 量化版本,进一步降低了开发者的上手与使用门槛。

第 6 集 · Meta新模型Muse Glimmer 30B获Llama.cpp零日支持并成功本地跑通(2026-08-10,2 条)

Meta 最新发布的 Muse Glimmer 30B 多模态模型获得了 Llama.cpp 的零日支持。在 Hugging Face 和 UnslothAI 的协助下,开发者成功将其 GGUF 格式在 Mac Studio 上本地运行。实测视频显示,该模型在两轮真实对话中跑出了 30 tok/s 的速度,展现出优秀的端侧多模态交互能力。