本科生魔改 GPTQ:4-bit Qwen2.5 困惑度优于官方 AWQ

Status-Adeptness8123 · reddit · 2026-10-05

一位本科生在 MacBook 上借助 Claude 当编码助手,用两周写出改进版 GPTQ 量化器,并由在 ML 行业的家人在 NVIDIA A10G 上用独立脚本复现结果。方法在标准 GPTQ 基础上加了三点:

零点用整数偏移,模型可打包进标准 AWQ 格式,直接跑 vLLM 的 awqmarlin 内核。

A10G + vLLM 0.29 上 WikiText-2 困惑度 / HumanEval pass@1 对比:

| 模型 | fp16 | 自制 4-bit | 官方 Qwen AWQ |

|---|---|---|---|

| Qwen2.5-1.5B | 9.37 / 37.2% | 9.66 / 33.5% | 10.16 / 34.1% |

| Qwen2.5-7B | 7.15 / 70.1% | 7.29 / 67.1% | 7.58 / 64.6% |

作者也坦承局限:每行只跑一次、HumanEval 差异在噪声范围内(约 3.6 分)、在 WikiText-2 上校准对困惑度测试有利(1.5B 上约值 0.3)、模型越大优势越小;3-bit 下代码与数学能力掉过半,不建议用于代码。代码、模型(含 MLX 版)与失败实验全部开源。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →