Reddit 实测:调两个采样参数,NVFP4 量化 Qwen3.8-27B 追平 BF16
UmpireBorn3719 · reddit · 2026-09-07
作者在 RTX 5090 上对比 Qwen3.8-27B 的 NInfer+NVFP4(4-bit 量化)与 llama.cpp+Q5KM 两种本地部署,用 IFBench(50 样本)评测。
关键发现:默认采样(temp=1.0, minp=0)下 Q5 strict 76% 略胜 NVFP4 的 74%。但 strict/loose 分差揭示了本质差异——NVFP4 的 loose 达 78%,4 分差距说明其失败多为缩进、大小写等格式噪音;Q5 两种口径都是 76%,失败全是真实能力缺陷。
据此作者把采样调到 temp=0.9、minp=0.05,NVFP4 strict 升到 80%,追平本地 BF16 并逼近官方 300 样本 BF16 基线 79.5%,Q5 则纹丝不动。结论:NVFP4 的失败几乎全是采样噪音,收紧后能以极低显存和近 3 倍速度拿到接近全精度的指令遵循能力;跑 NVFP4 量化还用默认采样等于自缚一手。作者提醒 n=50 有方差,但多次复跑方向一致。
「Infra」频道最新
- 开发者自制 llama.cpp 分支,让 MoE 模型支持专家数量扩展 — Specific-Tax-6700 · 2026-09-07
- 靠 ChatGPT 补贴跑 bot 两天仅赚 $2.60,作者担心断供 — TheMoonMidas · 2026-09-07
- NeurIPS 教育赛道推出投机解码交互式教程,讲透何时无损 — Madisonkanna · 2026-09-07
- Dell COO:AI 需求超过供给,DRAM、NAND、CPU、磁盘全面短缺 — mattwbaker · 2026-09-07
- 双 R9700 64GB 本地跑 Qwen3.8:全套 4 千欧,解码 111 tok/s — smallDeltaBigEffect · 2026-09-07
- $700 预算装本地 LLM:魔改卡与矿卡选购求助帖 — Current-Set1963 · 2026-09-07