72GB 显存跑 180B 模型?offload+剪枝实测

EyalToledano · x · 2026-08-27

通过结合 NVMe offload (PLE) 和专家剪枝 (REAP),在单张 48GB 显存卡上运行 180B 级别的大模型成为可能。技术细节如下:

该方案特别适合 MLX 框架,并能进一步将进程移至 CPU 以节省显存。

所属事件:Qwen3 180B 模型剪枝后可在笔记本运行(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →