Red Hat AI 推出 Muse-Glimmer 30B 的 FP8 量化版,显存占用减半
vllm_project · x · 2026-08-10
Red Hat AI 发布了 Meta 多模态模型 Muse-Glimmer 30B 的量化版本 Muse-Glimmer-30B-FP8-block。该版本采用块级 FP8 量化处理线性层,同时保持视觉编码器为全精度,在保留模型能力的前提下,将显存和磁盘占用大致减少了一半。该模型可通过 LLM Compressor 进行量化,并已完全兼容 vLLM 项目进行推理部署。
「Infra」频道最新
- Muse Glimmer 模型本地运行实测:单卡 RTX 5090 达 230 tok/s — BanghuaZ · 2026-08-11
- Karpathy:未来端侧小模型与云端大模型混合架构极具吸引力 — karpathy · 2026-08-11
- 本地跑MiniMaxH3视频生成:工作流与硬件升级实录 — Last-Pie8057 · 2026-08-10
- 8G显存跑大模型?解析本地部署的内存共享机制 — Leary_2844 · 2026-08-10
- SemiAnalysis 深度长文:NVIDIA GPU 如何挑战 Cerebras 与 Groq 的超低延迟推理 — dylan522p · 2026-08-10
- Ante 0.2 发布:15MB 的本地离线编程智能体 — Exciting-Camera3226 · 2026-08-10