vLLM 发布 Muse-Glimmer-30B 部署指南,支持本地多模态智能体
vllm_project · x · 2026-08-10
vLLM Recipes 发布了 Muse-Glimmer-30B 模型的部署指南。这是一个拥有 296 亿参数的稠密视觉语言模型,配备 ViT-G/14 感知编码器和 128K 上下文,专为消费级硬件上的本地智能体任务设计。
该模型的一大特色是其独特的输出格式:它不使用 JSON 工具调用,也不使用 <think> 标签包裹推理过程,而是采用频道范围的消息序列和 XML 风格的 ATEM 工具调用。部署时需要使用专门的 museglimmer 工具调用和推理解析器。目前提供 BF16、NVFP4 量化以及投机解码草案头等多种权重版本。
所属事件:Meta开源30B智能体模型Muse Glimmer,单卡即可运行(30 条相关)→
「Infra」频道最新
- llama.cpp首发支持Muse Glimmer模型 — jacek2023 · 2026-08-10
- 英特尔拟发行150亿美元股票,押注AI算力需求 — ryanshrout · 2026-08-10
- 云端大模型+本地小模型混合架构潜力大,Muse Spark 1.2即将开源 — jack_w_rae · 2026-08-10
- 实测 30B 模型跑出 114 tps,优化后有望在 16G 显存运行 — tokenbender · 2026-08-10
- DeepSeek API日耗仅1.14美元,自购双DGX回本需24年 — delduca · 2026-08-10
- 算力之后的新瓶颈:AI 数据中心面临电力短缺挑战 — ingliguori · 2026-08-10