标准评测测不出量化差异,自建 Agent 基准拉开 77% vs 98%

FeydRowan · reddit · 2026-10-11

作者花数周实测本地量化模型质量,结论:GSM8K、MMLU-Pro、IFEval 等标准评测完全区分不了不同量化档位,而 agent 任务上的差距巨大。

核心发现

测试环境:Ryzen 9 9900X、96GB DDR5、双 RTX 5070 Ti;GGUF 走 llama.cpp(-sm tensor、MTP draft、KV q80),NVFP4 走 vLLM TP=2,Flash-Next 3-bit 走 Strata v0.1.42。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →