开源 Colibri 让 7440 亿参数 GLM-5.2 跑上 25GB 笔记本
socialwithaayan · x · 2026-07-21
- 一个名为 colibri 的开源纯 C 运行时,声称可以在约 25GB 内存的消费级笔记本上运行 GLM-5.2 这个 7440 亿参数 MoE 模型。
- 核心思路是:每个 token 只激活大约 400 亿参数,其余专家从磁盘按需流式加载,并通过学习缓存把常用部分留在内存里。
- 配图给出了实测速度:25GB 开发机约 0.05 tok/s,128GB 纯 CPU 台式机约 1.8 tok/s,6× RTX 5090 全驻留可到 5.8–6.8 tok/s。
- 这个运行时被描述为 单文件、零依赖、纯 C,并且用 full-precision oracle 做了 token 级一致性验证;演示界面显示启动后常驻内存约 9.9GB。
所属事件:开源Colibri让7440亿参数大模型跑在笔记本上(2 条相关)→
「Infra」频道最新
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11