744B GLM-5.2模型可在25GB内存本地运行

近期技术社区热议如何在一台仅有 25GB 内存且无需 GPU 的消费级机器(甚至笔记本)上,本地运行参数量高达 744B 的 GLM-5.2 大模型。这一突破性尝试打破了海量参数对高端硬件的绝对依赖,引发了广泛关注。

核心运行机制

该方案之所以能在极低内存下运行,主要归功于对 MoE(混合专家)架构特性的极致利用与底层优化。根据多位博主的解析,GLM-5.2 虽然总参数达 744B,但在生成每个 token 时仅激活约 40B 参数。因此,系统(如 Colibrì 项目)会将需要高频调用的稠密部分常驻内存,而将庞大的专家权重卸载至 NVMe 硬盘存储。此外,系统还结合了 LRU 缓存机制以及 KV cache 压缩技术,进一步降低运行时的内存占用。

局限与代价

尽管在 25GB 内存设备上跑通 744B 模型令人瞩目,但该方案目前存在明显妥协。多位作者(如 @rohanpaulai)均指出,这种极端压缩内存的本地推理方式会导致生成速度非常缓慢,目前更多是作为技术可行性的概念验证,而非实用的生产级方案。

2026-07-10 ~ 2026-07-11 · 5 条相关

一手来源