本地 LLM 量化避坑指南:FP8/NVFP4 等格式的硬件门槛
Ill_Dragonfruit_3547 · reddit · 2026-08-20
作者分享了在本地运行 LLM 时关于量化和硬件兼容性的经验教训,指出量化格式是基于硬件而非仅仅为了压缩大小。
硬件代际与支持格式:
- Turing (RTX 20): FP16, INT8, INT4
- Ampere (RTX 30, A100): +BF16, TF32 (无原生 FP8)
- Ada Lovelace (RTX 40): +FP8 (E4M3/E5M2)
- Hopper (H100): +FP8, Transformer Engine
- Blackwell (RTX 50): +FP4 (NVFP4), FP6
格式分类与选择规则:
- 可移植格式(推荐):GGUF (通用), MLX (Apple Silicon 专属), fp16/bf16 safetensors (通用)。
- 硬件特定格式:FP8 (Ada/Hopper,Ampere 上加载慢), NVFP4 (Blackwell 专属,老显卡无用), EXL2/EXL3 (CUDA 专属), AWQ/GPTQ (CUDA 专属)。
核心建议:在 M1Max 上,LLM 选 MLX,Diffusion 选 GGUF 或 fp16 safetensors,其他格式大概率会报错或性能极差。
「Infra」频道最新
- 算力瓶颈阻碍 ML 研究,非 Ideas — A_K_Nain · 2026-08-20
- M3 Ultra 跑 27B 模型性能提升 45%,实测 CPU+GPU+ANE 协同 — AIFlow_ML · 2026-08-20
- 重启 llama.cpp 导致长对话预填慢?建议实现 KV 状态自动存盘 — Dazzling_Equipment_9 · 2026-08-20
- YC 新项目 Atomarine:把数据中心搬到海上解决算力瓶颈 — ycombinator · 2026-08-20
- AI 数据中心用水量引争议,动画展示实际影响 — ATTlKA · 2026-08-20
- Mojo集成MLIR栈运行矩阵乘法,ModCon大会演示异构计算 — clattner_llvm · 2026-08-20