实测:Qwen Flash Next IQ4_XS 四项基准全面胜过 27B FP8

smallDeltaBigEffect · reddit · 2026-09-25

作者用 Codex 对 Qwen 3.8 Flash Next IQ4XS(vllm + r9v 服务)与 Qwen 3.8 27B FP8(vllm + radiance 服务)做了基准对比:

| 基准 | Flash-Next IQ4XS | 27B FP8 | 胜者 |

|---|---|---|---|

| MMLU-Pro | 83.8% | 75.0% | Flash-Next |

| GPQA Diamond | 42.5% | 27.5% | Flash-Next |

| GSM8K | 97.5% | 90.0% | Flash-Next |

| German MGSM | 92.5% | 90.0% | Flash-Next |

| IFEval | 89.6% | 89.6% | 平 |

代价是速度:FP8 27B 完成 250 例「快速」测试仅用 36 分 27 秒,Flash-Next IQ4XS 耗时 2 小时 05 分 47 秒。硬件为 64GB DDR5 + 2×R9700(r9v 近期更新未纳入)。若用 128GB DDR5,可跑 tcclaviger 的 mxfp4 量化版,速度约提升 2 倍。

作者针对「FP8 27B 好于 QFN 低量化」的常见说法提出反证:IQ4XS 已算低量化,但本次评测与日常使用中均未见该说法成立,并征询更有指示性的基准建议。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →