专题 · FULL STORY
Meta开源Muse Glimmer:从发布到单卡实测
Meta发布300亿参数开源多模态模型Muse Glimmer,主打本地智能体工作流。模型发布后迅速获得llama.cpp首发支持,开发者随即在消费级显卡上完成极限部署与推理实测,展现其低显存长上下文优势。
2026-08-10 ~ 2026-08-11 · 6 集 · 73 条
第 1 集 · Meta开源30B端侧智能体模型Muse Glimmer(2026-08-10,51 条)
Meta超级智能实验室正式发布开源多模态模型Muse Glimmer,这是一款30B参数的稠密视觉语言模型,专为在消费级硬件上运行本地常驻智能体工作流而优化。模型采用Apache 2.0协议开放权重,显著降低了高级智能体的端侧部署门槛。官方称其为同等规模下最强的智能体模型,在24项基准测试中有12项取得最佳成绩,整体优于Gemma4-31B和Qwen3.6-27B。
已确认
- 模型规格:Muse Glimmer为30B参数的Dense架构(非MoE),由Muse蒸馏而来,配备ViT-G/14感知编码器。原生支持131K上下文、100多种语言以及文本与图像交织的多模态输入。
- 硬件要求:该模型对本地部署非常友好,可完全在单张消费级GPU上运行。根据不同转述,其运行显存需求在18GB至24GB之间,支持4-bit量化,并能通过Ollama的MLX引擎在Mac等设备上本地运行。PyTorch官方也宣布ExecuTorch框架新增了对该模型的支持。
- 性能表现:官方称其为同等规模下最强的智能体模型。在24项基准测试中有12项取得最佳成绩,整体表现优于Gemma4-31B和Qwen3.6-27B,其编码能力与同级别的Qwen 27B相当,并在关键智能体用例上表现优异。
- 适用场景:针对复杂的多步骤任务进行优化,适合隐私敏感型应用,如编程、文档分析和个人助理。
尚未确认
- Meta预告即将发布最新基础模型Muse Spark 1.2的开放权重版本,具体发布时间与详细参数暂未确定。
为什么重要
- Muse Glimmer显著降低了本地部署高级智能体的硬件门槛,使得全天候常驻的个人智能体能在标准PC上流畅运行。此外,这种“闭源旗舰+开源蒸馏”的双线并行策略,也被视为兼顾商业变现与开源生态建设的新尝试。扎克伯格也发文重申了Meta对开源AI的坚定承诺,并呼吁允许无限制的模型蒸馏。
- Meta 发布 Muse Glimmer 30B 模型,支持单消费级 GPU 本地运行 — alexandr_wang · 2026-08-10
- Meta 发布 Muse Glimmer:30B 开源端侧智能体模型,24GB 显存即可跑 — alexandr_wang · 2026-08-10
- Meta 发布 Muse Glimmer:专为本地智能体设计的 30B 开源模型 — AIatMeta · 2026-08-10
- Meta 发布 Muse Glimmer:专为端侧 Agent 优化的 30B 开源模型 — AIatMeta · 2026-08-10
- Meta将开源30B参数智能体模型Muse Glimmer,仅需24GB显存 — huggingface · 2026-08-10
- Meta发布Muse-Glimmer-30B多模态模型,支持4-bit运行 — NielsRogge · 2026-08-10
- Meta 发布 Muse Glimmer 30B 模型,18GB 显存即可本地运行 — danielhanchen · 2026-08-10
- Meta 发布 30B 开源模型 Muse Glimmer,Agentic 能力领先 — kimmonismus · 2026-08-10
- Meta 开源 Muse 模型:300 亿参数 Glimmer 已上线,24GB 显存可跑 — ns123abc · 2026-08-10
- Meta 开源 30B 视觉语言模型 Muse Glimmer — ariG23498 · 2026-08-10
- Hugging Face 详解 Muse Glimmer:专为本地智能体设计 — ariG23498 · 2026-08-10
- Meta 发布 Muse Glimmer 30B 多模态模型,主打本地智能体 — mervenoyann · 2026-08-10
- Alexandr Wang 确认 Meta 将发布开源智能体模型 Muse Glimmer — rohanpaul_ai · 2026-08-10
- Muse Glimmer 30B 权重上线 Hugging Face — ns123abc · 2026-08-10
- Meta 重回开源:Muse Glimmer 30B 模型及 NVFP4 量化版发布 — Xianbao_QIAN · 2026-08-10
- Meta发布开源30B本地Agent模型Muse Glimmer — hsu_byron · 2026-08-10
- Muse Glimmer 30B 模型权重发布,主打本地多模态智能体 — tokenbender · 2026-08-10
- Meta重磅发布Muse Glimmer:30B参数开源多模态Agent模型 — pcuenq · 2026-08-10
- Meta 开源端侧 30B 智能体模型,闭源旗舰+开源蒸馏双线并行 — eyishazyer · 2026-08-10
- Meta 官方发布 Muse Glimmer:Apache 2.0 开源端侧智能体模型 — aigclink · 2026-08-10
第 2 集 · Meta将开源30B参数Muse Glimmer及Muse Spark 1.2(2026-08-10,4 条)
据多方爆料,Meta即将重返开源权重模型领域,发布30B参数的稠密模型Muse Glimmer及Muse Spark 1.2。新模型架构融合Gemma 4与视觉能力,已在Hugging Face曝光。早期测试者反馈,该模型虽未触及中国厂商开源模型的天花板,但有望夺回非中国开源最强地位。
- Meta 杀回开源:疑似发布 300 亿参数模型 Muse Glimmer — iScienceLuvr · 2026-08-10
- Meta 将开源 Muse Glimmer 30B 与 Muse Spark 1.2 — insumanth · 2026-08-10
- 曝 Meta 将发 30B 新开源模型,架构融合 Gemma 4 与视觉 — ivan_bezdomny · 2026-08-10
- 曝 Meta 将发 300 亿参数新模型,夺回非中国开源最强 — ivan_bezdomny · 2026-08-10
第 3 集 · Meta发布Muse Glimmer:实测展现自主部署与优化能力(2026-08-10,6 条)
Meta发布了专为本地智能体设计的300亿参数开源多模态模型Muse Glimmer。开发者实测表明,该模型不仅能自主完成部署与环境适配,还能在极低内存下保持长程工具调用能力,展现了极高的智能体自动化潜力。
已确认
- 模型发布:Meta发布300亿参数开源多模态模型Muse Glimmer,专为本地智能体设计,Hugging Face提供了首日支持。
- 自主部署与量化:开发者benburtenshaw实测,赋予模型工具调用能力后,它成功完成了自我量化操作,并将自身部署到受保护的Hugging Face Inference Endpoint,自动完成了健康状态检查和聊天补全验证。
- 硬件优化:在进阶测试中,该模型成功针对H100架构,自主优化了其部署配置。
- 低资源工具调用:UnslothAI展示了通过2-bit GGUF量化技术,该模型在仅消耗14GB RAM的条件下,成功实现了连续调用100多个工具的能力。
- 体验入口:benburtenshaw已在Hugging Face Hub上搭建了研究智能体入口,方便其他开发者直接交互测试。
为什么重要
- 这些测试直观展示了AI模型从被动生成文本向主动执行复杂系统任务的转变。模型能够自主完成部署、环境适配与硬件优化,为未来AI自动化运维提供了极具价值的参考。同时,低至14GB内存即可运行百次工具调用的特性,大幅降低了端侧复杂智能体的硬件门槛。
- 实测 Meta 新开源模型 Muse Glimmer:让 AI 自我量化与部署 — ben_burtenshaw · 2026-08-10
- 让 AI 自主部署:Muse Glimmer 模型实测演示 — ben_burtenshaw · 2026-08-10
- Hugging Face 上线 Muse Glimmer 研究智能体测试入口 — ben_burtenshaw · 2026-08-10
- 让 AI 为 H100 优化自身部署:Muse Glimmer 实测进阶 — ben_burtenshaw · 2026-08-10
- Meta 展示 Muse Glimmer:让大模型自主部署至 HF 并优化推理 — AIatMeta · 2026-08-10
- 2-bit量化版Muse Glimmer在14GB内存实现百次工具调用 — danielhanchen · 2026-08-10
第 4 集 · 单卡极限跑Muse Glimmer等大模型:长上下文与高TPS实测(2026-08-10,8 条)
近期,开发者社区展示了在单张消费级显卡上极限部署和优化大语言模型的惊人结果,核心焦点在于通过DFlash、NVFP4及特定量化技术大幅提升推理速度并突破显存长上下文限制。
已确认
- 高推理速度:多位开发者实测 Meta Muse Glimmer 30B 模型在单张 RTX 5090 显卡上具有极高的生成速度。@Scobleizer 报告平均速度达 208 tps,最高 274 tps;@NVIDIAAI 和 @BanghuaZ 指出在 SGLang 框架下开启 NVFP4 和 DFlash 优化,速度约为 230 tok/s。@tokenbender 和 @dejavucoder 则通过 tuned quants 和 dflash 技术,让该模型达到了 114 tokens/s 的推理速度,并认为优化后有望在 16G 显存中运行。
- 长上下文极限:@coder543 在单张 RTX 3090(24GB)上使用 Q4KXL 量化、DFlash 及 mmproj,成功让 Muse Glimmer 30B 模型完整支持 256k 上下文,显存占用仅约 22GB。@ydnar 也分享了在 RTX 3090 上部署该模型的具体配置与显存权衡。此外,@Anbeeld 报告了一项更极端的测试:在单张 RTX 3090 上为占用约 17GB 显存的 Qwen 3.5 35B A3B 模型加载了近 100 万 token 的上下文。
为什么重要
- 降低本地部署门槛:这些实测表明,结合最新的量化与底层优化技术,原本需要昂贵算力的高参数模型(如30B级别)及其超长上下文能力,已经能够浓缩进单张主流消费级显卡中流畅运行。这不仅极大降低了个人开发者的研究与应用门槛,也为大模型的本地化、隐私化部署提供了切实可行的路径。
- 单张RTX 3090跑百万token上下文:KVarN量化突破极限 — Anbeeld · 2026-08-10
- 实测 30B 模型跑出 114 tps,优化后有望在 16G 显存运行 — tokenbender · 2026-08-10
- SGLang 首发支持 Meta 新模型 Muse Glimmer,单卡吞吐量达 230 tok/s — NVIDIAAI · 2026-08-10
- 单卡跑满 256k 上下文:实测 Muse Glimmer 30B 本地部署显存与性能 — coder543 · 2026-08-10
- 30B 模型跑出 114 TPS:开发者实测量化与切片技术 — dejavucoder · 2026-08-10
- Muse Glimmer 模型本地运行实测:单卡 RTX 5090 达 230 tok/s — BanghuaZ · 2026-08-11
- RTX 3090 部署 30B 模型实战:显存与量化级别的极限权衡 — ydnar · 2026-08-11
- 单卡 RTX 5090 跑 274 tps,实测 Meta 新模型 Muse Glimmer — Scobleizer · 2026-08-11
第 5 集 · llama.cpp首发支持Meta新模型Muse Glimmer(2026-08-10,2 条)
开源推理框架 llama.cpp 宣布对 Meta 最新开源的 Muse Glimmer 模型实现 Day-0(首发日)级别支持。这意味着开发者可以在模型发布的第一时间,直接利用 llama.cpp 框架进行推理部署。同时,Meta 官方也同步提供了 GGUF 量化版本,进一步降低了开发者的上手与使用门槛。
- llama.cpp Day-0 支持 Meta 新模型 Muse Glimmer — ggerganov · 2026-08-10
- llama.cpp首发支持Muse Glimmer模型 — jacek2023 · 2026-08-10
第 6 集 · Meta新模型Muse Glimmer 30B获Llama.cpp零日支持并成功本地跑通(2026-08-10,2 条)
Meta 最新发布的 Muse Glimmer 30B 多模态模型获得了 Llama.cpp 的零日支持。在 Hugging Face 和 UnslothAI 的协助下,开发者成功将其 GGUF 格式在 Mac Studio 上本地运行。实测视频显示,该模型在两轮真实对话中跑出了 30 tok/s 的速度,展现出优秀的端侧多模态交互能力。
- 实测 Meta 新模型 Muse Glimmer 30B:Mac Studio 本地跑出 30 tok/s — MaziyarPanahi · 2026-08-10
- Muse Glimmer 30B 模型获 Llama.cpp 零日支持,Mac Studio 本地跑通 — MaziyarPanahi · 2026-08-10