标准评测测不出量化差异,自建 Agent 基准拉开 77% vs 98%
FeydRowan · reddit · 2026-10-11
作者花数周实测本地量化模型质量,结论:GSM8K、MMLU-Pro、IFEval 等标准评测完全区分不了不同量化档位,而 agent 任务上的差距巨大。
核心发现
- Qwen3.8-27B 的五种量化(UD-Q4KXL 到 Q80、NVFP4)在三个标准评测上得分全部落在 ±2 分内;Q4 每 28 个 token 才与 Q8 选词不同一次,但评测毫无察觉。差异甚至不单调:最不保真的 Q4 反而拿下最高 IFEval。只有 KLD/top-1 一致性能给量化排序,且只需 40 秒。作者仍选 Q4KXL 日常用:比 Q8 快 33% 解码、上下文长 7.5 倍(24.5 万)。
- 跨模型对比:27B、Flash-Next、Gemma 4 26B/31B、Claude Sonnet 5.5 在 GSM8K 上全部挤在 96.8–98.5%,已饱和。
- 自建 agent 基准(往自己仓库注 bug、隐藏测试、每模型 112 次运行、OpenCode)才显出差距:27B NVFP4 解 77%,Flash-Next NVFP4 解 98%;6 个最难任务上 1/12 vs 12/12。SWE-rebench 佐证(69% vs 82%,p≈0.007)。
- Flash-Next 约 3-bit(GSQ IQ3S on Strata)本地运行在 12 个区分性任务中 11 个追平 NVFP4,但每次都漏掉同一类特定 bug。
- Harness 也重要:四个 harness 解题率相同,但 OpenCode 快 2–4 倍且通过全部安全探测。
测试环境:Ryzen 9 9900X、96GB DDR5、双 RTX 5070 Ti;GGUF 走 llama.cpp(-sm tensor、MTP draft、KV q80),NVFP4 走 vLLM TP=2,Flash-Next 3-bit 走 Strata v0.1.42。
「模型」频道最新
- Google 发布 EmbeddingGemma 2:7.4 亿参数多模态嵌入可跑在手机上 — dl_weekly · 2026-10-11
- 爆料称 Grok 4.8 参数达 2.5 万亿,较上代激增 67% 即将发布 — mark_k · 2026-10-11
- TensorFold 1.0.7 上线 Living Weights:一条事实写入约 10 个新神经元 — HankYeomans · 2026-10-11
- Arena 榜单 88 分 vs 83 分差多少?实测误差率相差一倍 — i_dg23 · 2026-10-11
- 曝 Anthropic 下一代模型 Fable 5.5 一次生成即成 SVG — koltregaskes · 2026-10-11
- OpenAI 确认 Codex 用量额度今日全球重置 — JeremyNguyenPhD · 2026-10-11