量化模型分数超原版?实测揭示评测陷阱与过拟合

teortaxesTex · x · 2026-08-24

针对模型量化评测的批判性讨论。观点指出,当量化模型的表现超过原始参考模型时,这意味着量化过程在测试集上发生了过拟合,同时也表明该评测已失效。该讨论基于一项对 Qwen3.8 27B 模型从 FP8 到 2 bit 的详细测试,历时 235 小时,展示了不同量化格式的真实表现。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →