实测:Qwen Flash Next IQ4_XS 四项基准全面胜过 27B FP8
smallDeltaBigEffect · reddit · 2026-09-25
作者用 Codex 对 Qwen 3.8 Flash Next IQ4XS(vllm + r9v 服务)与 Qwen 3.8 27B FP8(vllm + radiance 服务)做了基准对比:
| 基准 | Flash-Next IQ4XS | 27B FP8 | 胜者 |
|---|---|---|---|
| MMLU-Pro | 83.8% | 75.0% | Flash-Next |
| GPQA Diamond | 42.5% | 27.5% | Flash-Next |
| GSM8K | 97.5% | 90.0% | Flash-Next |
| German MGSM | 92.5% | 90.0% | Flash-Next |
| IFEval | 89.6% | 89.6% | 平 |
代价是速度:FP8 27B 完成 250 例「快速」测试仅用 36 分 27 秒,Flash-Next IQ4XS 耗时 2 小时 05 分 47 秒。硬件为 64GB DDR5 + 2×R9700(r9v 近期更新未纳入)。若用 128GB DDR5,可跑 tcclaviger 的 mxfp4 量化版,速度约提升 2 倍。
作者针对「FP8 27B 好于 QFN 低量化」的常见说法提出反证:IQ4XS 已算低量化,但本次评测与日常使用中均未见该说法成立,并征询更有指示性的基准建议。
「Infra」频道最新
- MLPerf v6.1 推出首个 LLM 后训练基准:397B 模型跑智能体 RL 修软件 — TheKanter · 2026-09-25
- KV 缓存引入虚拟内存:kvcached 已部署超万卡 GPU — techNmak · 2026-09-25
- 作者重返 IEEE 演讲:从芯片到模型全栈微优化以小博大 — fooobar · 2026-09-25
- 开发者自建 AI 获客工作流,断言下时代入口属 OS 级硬件 — dotey · 2026-09-25
- WSJ:AI 关键内存芯片价格飙升令美国陷入两难 — pstAsiatech · 2026-09-25
- 铌酸锂高速调制器新演示,双波段光栅耦合器设计更亮眼 — jwt0625 · 2026-09-25