744B GLM-5.2模型可在25GB内存本地运行
近期技术社区热议如何在一台仅有 25GB 内存且无需 GPU 的消费级机器(甚至笔记本)上,本地运行参数量高达 744B 的 GLM-5.2 大模型。这一突破性尝试打破了海量参数对高端硬件的绝对依赖,引发了广泛关注。
核心运行机制
该方案之所以能在极低内存下运行,主要归功于对 MoE(混合专家)架构特性的极致利用与底层优化。根据多位博主的解析,GLM-5.2 虽然总参数达 744B,但在生成每个 token 时仅激活约 40B 参数。因此,系统(如 Colibrì 项目)会将需要高频调用的稠密部分常驻内存,而将庞大的专家权重卸载至 NVMe 硬盘存储。此外,系统还结合了 LRU 缓存机制以及 KV cache 压缩技术,进一步降低运行时的内存占用。
局限与代价
尽管在 25GB 内存设备上跑通 744B 模型令人瞩目,但该方案目前存在明显妥协。多位作者(如 @rohanpaulai)均指出,这种极端压缩内存的本地推理方式会导致生成速度非常缓慢,目前更多是作为技术可行性的概念验证,而非实用的生产级方案。
2026-07-10 ~ 2026-07-11 · 5 条相关
一手来源
- 744B大模型可在25GB内存运行 — techNmak ·
- 744B模型可在笔记本本地运行 — WesEklund ·
- 744B GLM可在25GB内存上跑 — rohanpaul_ai ·
- GLM-5.2 可在 25GB 内存机运行 — yogthos · 2026-07-10
- 【源头】744B GLM可在25GB内存上跑 — rohanpaul_ai · 2026-07-10
- GLM-5.2本地运行机制解析 — rohanpaul_ai · 2026-07-10
- 【源头】744B大模型可在25GB内存运行 — techNmak · 2026-07-11
- 【源头】744B模型可在笔记本本地运行 — WesEklund · 2026-07-11