Minima 将 27B 混合大模型全层量化至 NVFP4
论文 Minima 提出将 Qwen3.8-27B 的全部 496 个线性层量化至 NVFP4 W4A4,体积缩小 2.9 倍。研究发现混合架构 LLM 中含循环的 Gated DeltaNet 部分其实很容易量化,长上下文与推理基准精度基本无损,关键在于离线校准等处理方式。
2026-09-04 ~ 2026-09-05 · 2 条相关
- Gated DeltaNet 为何扛住 4-bit:27B 混合 LLM 全 NVFP4 W4A4 量化实验 — minima-ai · 2026-09-04
- Minima 将 Qwen3.8-27B 全部 496 层量化至 NVFP4 W4A4,体积缩 2.9 倍 — pbaylies · 2026-09-05