Qwen3.6 NVFP4量化提速
danielhanchen · reddit · 2026-07-10
Unsloth 发布了针对 Qwen3.6 的 NVFP4 量化方案,声称在不损失精度的前提下,把 27B 模型的推理速度提升到 NVIDIA NVFP4 的 2.5x,把 35B-A3B 提升到 1.56x–1.79x。
帖子同时给出了几组基准对比,包括 MMLU-Pro、GPQA、AIME 2025 和 BF16 / FP8 / NVIDIA NVFP4 的结果;作者还提到加入了 FP8 KV Cache calibration,可让上下文长度自动变成 2x。文中区分了两版 35B:一版更偏速度(NVFP4-Fast),一版在速度和精度之间稍作折中。
相关量化模型已放到 Hugging Face,并在博客里补充了更完整的分析和 benchmark。
所属事件:Unsloth推Qwen3.6 NVFP4量化提速(3 条相关)→
「Infra」频道最新
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11
- 本地跑 LLM 选卡:4 张 CMP-170HX 涨价 vs Mac Studio M5 — rumboll · 2026-09-11
- llama.cpp 为 RDNA4 调优 Flash Attention,大上下文提升明显 — pmttyji · 2026-09-11