开源 Colibri 让 7440 亿参数 GLM-5.2 跑上 25GB 笔记本
socialwithaayan · x · 2026-07-21
- 一个名为 colibri 的开源纯 C 运行时,声称可以在约 25GB 内存的消费级笔记本上运行 GLM-5.2 这个 7440 亿参数 MoE 模型。
- 核心思路是:每个 token 只激活大约 400 亿参数,其余专家从磁盘按需流式加载,并通过学习缓存把常用部分留在内存里。
- 配图给出了实测速度:25GB 开发机约 0.05 tok/s,128GB 纯 CPU 台式机约 1.8 tok/s,6× RTX 5090 全驻留可到 5.8–6.8 tok/s。
- 这个运行时被描述为 单文件、零依赖、纯 C,并且用 full-precision oracle 做了 token 级一致性验证;演示界面显示启动后常驻内存约 9.9GB。
所属事件:开源Colibri让7440亿参数大模型跑在笔记本上(2 条相关)→
「Infra」频道最新
- 一组系列文章在测试数据科学工作流能否跑满 GPU — pandeyparul · 2026-07-21
- 前 AWS 高管称 Bedrock 利润高于 SageMaker,AI 将推高 CPU 需求 — RihardJarc · 2026-07-21
- Engram 展示智能体记忆如何异步重写事实 — philipvollet · 2026-07-21
- Lightning AI 推出 LitLogger,自动记录训练指标与环境信息 — LightningAI · 2026-07-21
- Moonshot 因 GPU 需求暴涨暂停 Kimi K3 新注册 — eyishazyer · 2026-07-21
- 微软扩大 Mistral 模型接入,覆盖 Azure 全家桶 — arthurmensch · 2026-07-21