Unsloth推出Gemma 4量化版降低推理显存门槛

Unsloth 发布了基于 google/gemma-4-E2B-it 的 NVFP4 量化版本模型。该量化模型支持图生文任务,主打更快的 GPU 推理速度与更低的显存占用。其中,120 亿参数规模的版本仅需 11GB 显存即可运行,大幅降低了开发者运行多模态大模型的硬件门槛。

2026-07-15 ~ 2026-07-15 · 2 条相关