Qwen3.6 NVFP4量化提速

danielhanchen · reddit · 2026-07-10

Unsloth 发布了针对 Qwen3.6 的 NVFP4 量化方案,声称在不损失精度的前提下,把 27B 模型的推理速度提升到 NVIDIA NVFP4 的 2.5x,把 35B-A3B 提升到 1.56x–1.79x。

帖子同时给出了几组基准对比,包括 MMLU-Pro、GPQA、AIME 2025 和 BF16 / FP8 / NVIDIA NVFP4 的结果;作者还提到加入了 FP8 KV Cache calibration,可让上下文长度自动变成 2x。文中区分了两版 35B:一版更偏速度(NVFP4-Fast),一版在速度和精度之间稍作折中。

相关量化模型已放到 Hugging Face,并在博客里补充了更完整的分析和 benchmark。

所属事件:Unsloth推Qwen3.6 NVFP4量化提速(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →