72GB 显存跑 180B 模型?offload+剪枝实测
EyalToledano · x · 2026-08-27
通过结合 NVMe offload (PLE) 和专家剪枝 (REAP),在单张 48GB 显存卡上运行 180B 级别的大模型成为可能。技术细节如下:
- mmap 优化:在 Apple 统一内存架构上,mmap + page-in-touched-rows 可将 51GB 的 n-gram 表留在 SSD,仅按需调入,几乎无性能损耗。
- 性能表现:Qwen3.8-Flash-Next (Q4KXL) 实测约 22 tok/s 解码,500-660 tok/s 预填充,长语境下 Decode 性能仅下降 13%。
- 双重压缩:
- PLE offload 将 25GB 的表从显存移至 SSD。
- REAP-256 剪枝将 63GB 专家池缩小。
- 最终效果:模型大小可从原生压缩至 40GB,实现在 48GB VRAM 上运行 180B 模型。
该方案特别适合 MLX 框架,并能进一步将进程移至 CPU 以节省显存。
所属事件:Qwen3 180B 模型剪枝后可在笔记本运行(2 条相关)→
「Infra」频道最新
- 手把手:用 Terraform 与 GitHub Actions 将 Agent 部署至 AWS ECS — kmeanskaran · 2026-08-28
- AMD ROCm 10.0.0 发布:扩展支持矩阵并简化安装流程 — AnushElangovan · 2026-08-28
- llama.cpp 合并 DFlash2 支持:本地卷积加候选选择器 — DjCanalex · 2026-08-28
- Gemma 4 MLX 挑战赛启动,Mac 端性能提升 8% — gajesh · 2026-08-28
- llama.cpp 合入 DFlash2:局部卷积+候选选择器上本地推理 — jacek2023 · 2026-08-28
- Google 探讨无状态 MCP,助 Agent 工具弹性伸缩 — rseroter · 2026-08-28