Reddit 实测:调两个采样参数,NVFP4 量化 Qwen3.8-27B 追平 BF16

UmpireBorn3719 · reddit · 2026-09-07

作者在 RTX 5090 上对比 Qwen3.8-27B 的 NInfer+NVFP4(4-bit 量化)与 llama.cpp+Q5KM 两种本地部署,用 IFBench(50 样本)评测。

关键发现:默认采样(temp=1.0, minp=0)下 Q5 strict 76% 略胜 NVFP4 的 74%。但 strict/loose 分差揭示了本质差异——NVFP4 的 loose 达 78%,4 分差距说明其失败多为缩进、大小写等格式噪音;Q5 两种口径都是 76%,失败全是真实能力缺陷。

据此作者把采样调到 temp=0.9、minp=0.05,NVFP4 strict 升到 80%,追平本地 BF16 并逼近官方 300 样本 BF16 基线 79.5%,Q5 则纹丝不动。结论:NVFP4 的失败几乎全是采样噪音,收紧后能以极低显存和近 3 倍速度拿到接近全精度的指令遵循能力;跑 NVFP4 量化还用默认采样等于自缚一手。作者提醒 n=50 有方差,但多次复跑方向一致。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →