Red Hat AI 推出 Muse-Glimmer 30B 的 FP8 量化版,显存占用减半

vllm_project · x · 2026-08-10

Red Hat AI 发布了 Meta 多模态模型 Muse-Glimmer 30B 的量化版本 Muse-Glimmer-30B-FP8-block。该版本采用块级 FP8 量化处理线性层,同时保持视觉编码器为全精度,在保留模型能力的前提下,将显存和磁盘占用大致减少了一半。该模型可通过 LLM Compressor 进行量化,并已完全兼容 vLLM 项目进行推理部署。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →