Minima 将 Qwen3.8-27B 全部 496 层量化至 NVFP4 W4A4,体积缩 2.9 倍
pbaylies · x · 2026-09-05
HuggingPapers 转发的论文指出,混合架构 LLM 的循环(recurrent)部分其实很容易量化。Minima 方法将 Qwen3.8-27B 的全部 496 个线性层——包括 Gated DeltaNet 循环层——量化到 NVFP4 W4A4,在体积缩小约 2.9 倍的情况下性能与 BF16 持平,说明混合线性注意力模型的循环半边并非量化难点。
所属事件:Minima 将 27B 混合大模型全层量化至 NVFP4(2 条相关)→
「Infra」频道最新
- Qwen3.5 9B 手机端全本地跑通 Agent:推理、写码、生成 PDF 一条龙 — fuzhongkai · 2026-09-05
- AI Agent 落地生产后的失控难题:有人在造「Agent 版 SRE 控制层」 — Fantastic-Sleep-3352 · 2026-09-05
- 爆料称美前沿实验室堆 GPU 只为追最后 1-3% 模型性能 — SumitGup · 2026-09-05
- Arm CEO:没有计算问题离得开微处理器,CPU 不会死 — No Priors · 2026-09-05
- 开发者实测 NVIDIA 版 Deepseek V4 NVFP4:1M 上下文下显存占用 96% — HankYeomans · 2026-09-05
- 端侧实时换脸开源项目:骁龙 NPU 跑通前置摄像头实时 FaceSwap — Few_Caregiver8134 · 2026-09-05