量化原理手册:从仿射量化讲到 GPTQ、AWQ 与 FP8
techNmak · x · 2026-09-28
techNmak 整理了一份系统讲解模型量化的手册,目标是回答「4-bit 到底意味着什么」以及「更低位宽为何省显存却不一定提速推理」。
内容覆盖:
- 仿射整数量化基础:scales、zero-points、rounding、clipping 与不同量化粒度
- 对称/非对称量化,per-tensor/per-channel/per-group 缩放,校准,PTQ 与 QAT
- weight-only 与激活量化、离群值处理
- GPTQ、AWQ、SmoothQuant、LLM.int8()、NF4 与 QLoRA
- FP8、KV-cache 量化(KIVI、KVQuant)
- 让低精度真正有效的 kernel 与硬件层面问题
所属事件:系统性讲解大模型量化原理的手册发布(2 条相关)→
「Infra」频道最新
- 8 张水冷 GPU 实战派:本地推理训练强烈建议给 GPU 上水冷 — HanchungLee · 2026-09-28
- vLLM transformers 后端已达原生速度,接入即免移植 — ariG23498 · 2026-09-28
- 用自托管 K3 集群跑自主 Infra 研究,token 随便烧不限量 — Xianbao_QIAN · 2026-09-28
- 字节 Seed 提出 PISA:块稀疏注意力复杂度降至 O(NlogN) — ByteDance-Seed · 2026-09-28
- 为单一模型裁剪 llama.cpp,Reddit 热议 2 倍推理提速设想 — segmond · 2026-09-28
- 5 张矿卡拼出"怪兽":不到 $800 跑 Qwen3-Coder-Next 达 40 tok/s — Ok-Breadfruit-3523 · 2026-09-28