Qwen3.6 NVFP4 提速 2.5 倍
danielhanchen · x · 2026-07-10
Unsloth 基于自己的动态方法,把 Qwen3.6 的 NVFP4 量化做到了更快的推理速度。
帖子里给出的结果包括:
- Qwen3.6-27B 的 NVFP4 版本相较原方案提速 2.5x
- 使用 W4A4 对比 W4A16
- 35B-A3B 还有两个版本:
- NVFP4:1.56x 更快
- NVFP4-Fast:1.79x 更快
其中 Fast 版本使用纯 W4A4,非 Fast 版本则混合使用不同精度,以在速度和准确性之间做折中。原帖还提到这些量化版本提升了 accuracy、tool calling、agent use 和 looping 表现。
所属事件:Unsloth推Qwen3.6 NVFP4量化提速(3 条相关)→
「Infra」频道最新
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11