本科生魔改 GPTQ:4-bit Qwen2.5 困惑度优于官方 AWQ
Status-Adeptness8123 · reddit · 2026-10-05
一位本科生在 MacBook 上借助 Claude 当编码助手,用两周写出改进版 GPTQ 量化器,并由在 ML 行业的家人在 NVIDIA A10G 上用独立脚本复现结果。方法在标准 GPTQ 基础上加了三点:
- 每组量化网格按权重拟合,而非 min-max;
- 第二遍逐一复检每个舍入后的权重;
- 网格根据层输入统计重新拟合。
零点用整数偏移,模型可打包进标准 AWQ 格式,直接跑 vLLM 的 awqmarlin 内核。
A10G + vLLM 0.29 上 WikiText-2 困惑度 / HumanEval pass@1 对比:
| 模型 | fp16 | 自制 4-bit | 官方 Qwen AWQ |
|---|---|---|---|
| Qwen2.5-1.5B | 9.37 / 37.2% | 9.66 / 33.5% | 10.16 / 34.1% |
| Qwen2.5-7B | 7.15 / 70.1% | 7.29 / 67.1% | 7.58 / 64.6% |
作者也坦承局限:每行只跑一次、HumanEval 差异在噪声范围内(约 3.6 分)、在 WikiText-2 上校准对困惑度测试有利(1.5B 上约值 0.3)、模型越大优势越小;3-bit 下代码与数学能力掉过半,不建议用于代码。代码、模型(含 MLX 版)与失败实验全部开源。
「Infra」频道最新
- XFreeze:未来 1-3 年 HBM 存储优势将决定超级智能竞赛 — XFreeze · 2026-10-06
- 69.1 万 H100 小时:从零训练检查点算力估算引算力门槛讨论 — teortaxesTex · 2026-10-06
- 开发者实测:Clef-Flash 在 Jetson Orin 本地推理也很流畅 — gregmushen · 2026-10-06
- 把 llama.cpp 编译成 WASM:纯浏览器端跑 LLM 的概念验证 — Numerous-Fan8138 · 2026-10-06
- Llama.wasm 开源:llama.cpp 编译 WASM+WebGPU,浏览器本地跑 LLM — Numerous-Fan8138 · 2026-10-06
- 英伟达 Dynamo 支持把编码智能体直连自托管端点,内置追踪回放 — TheZachMueller · 2026-10-06