Hugging Face 新增 NVFP4 内核支持,显存占用降 61%

ariG23498 · x · 2026-08-21

文章介绍了 NVFP4 量化格式在降低显存占用方面的显著效果。以 Muse Glimmer 模型为例,使用 NVFP4 可将显存从 59.62 GB 降至 23.07 GB(减少 61%)。关键在于,Hugging Face transformers 库通过 PR 47883 引入了原生 NVFP4 通用矩阵乘法(GEMM)内核支持,使得模型不仅能在加载时量化,还能直接以 NVFP4 格式进行计算而无需反量化,从而在降低显存的同时提升生成速度。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →