744B大模型可在25GB内存运行
techNmak · x · 2026-07-11
这条帖子介绍了一个把 744B 参数模型跑在 25GB RAM 上的推理方案,且 不需要 GPU。关键不是把整个模型塞进内存,而是让大部分权重根本不常驻 RAM。
核心思路
- GLM-5.2 是 MoE 模型:总参数 744B,但每个 token 只激活约 40B。
- Colibrì 把推理当成内存层级问题:
- 常用权重留在 RAM
- 21,504 个路由专家放在 NVMe
- 路由器按需选专家并从磁盘流式加载
- 热门专家会被缓存到闲置 RAM
- 整个 int4 模型在磁盘上约占 370GB,但常驻内存约 9.9GB,聊天时峰值 RAM 约 20GB。
现实限制
- 在原始 25GB 机器上,生成速度只有约 0.05–0.1 tokens/s,因为单个 token 可能需要约 11GB 的磁盘读取。
- 这不是快到可用于生产的推理,而是证明:对稀疏模型来说,模型体积和常驻内存不必再一一对应。
- 运行时还会记录提示词激活了哪些专家,并自动把最常用专家固定在额外 RAM 中,因此重复使用可能更快。
仍未解决的问题
- 项目尚未完成完整 benchmark,因此 int4 量化对模型质量的影响 还不明确。
- 项目是 纯 C 实现、无运行时依赖,并且是一个人用 12 核笔记本完成的。
所属事件:744B GLM-5.2模型可在25GB内存本地运行(5 条相关)→
「Infra」频道最新
- AI 工程师必懂的 12 种 KV Cache 压缩技术一文讲透 — blaizedsouza · 2026-09-11
- 影子算力市场走向台前,Meta 对外出售过剩 GPU 算力成标志性信号 — DavidLinthicum · 2026-09-11
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11