Qwen3.8-27B NVFP4 量化横评:lm_head 精度决定 MTP 加速成色
danielhanchen · x · 2026-09-14
- Unsloth 的 Daniel Han 转发对比了多个 Qwen3.8-27B NVFP4 量化版本:各家精度相近,真正差异在显存占用与速度。
- 显存受限可选 minima-ai/mnmaqwen3.827bnvfp4,但不带 MTP 加速推理;NVIDIA 版本含 MTP,但长上下文编码测试中 MTP-4 仅约 2 倍于无 MTP,仍比 Unsloth 慢 2.5–3 倍(RTX Pro 6000)。
- 作者推测关键原因:NVIDIA 把 lmhead 也量化到 NVFP4,而 Unsloth 保留 FP8;由于 MTP 与主模型共享 lmhead,这会拖累预测质量与接受率。
- 结论:首选 Unsloth NVFP4,正在测试长程 agentic 编码精度。
「Infra」频道最新
- 2400 美元捡漏 384GB 内存+双 RTX 6000 工作站,该拿来跑什么? — ABDULLAH3_33 · 2026-09-14
- Nvidia 携手 IREN 等伙伴,2027 年前在澳建成 2GW AI 算力 — Beth_Kindig · 2026-09-14
- MiniMax 3步 Turbo LoRA 实测:RTX 5090 上 2 分钟出带音频视频 — agapes1270 · 2026-09-14
- 马斯克:SpaceX 明年将在太空部署 Nvidia AI 计算机 — inductionheads · 2026-09-14
- AI 程序化生成 FlashAttention:CuTe 分块产出可运行 CUDA 代码 — vtabbott_ · 2026-09-14
- 小团队训练基建 Tahuna 开源:训练推理编排一站搞定 — Monaim101 · 2026-09-14