25GB 内存跑 744B 模型:纯 C 推理框架 Colibrì 揽 32k Star
量子位 · wechat · 2026-09-26
GitHub 热门开源项目 Colibrì 用分层内存调度让消费级电脑跑超大 MoE 模型,纯 C 实现、零引擎依赖,已获 32k Star。
核心思路
- MoE 每 token 只激活少量专家(如 GLM-5.2 总参 744B、激活约 40B),Colibrì 把 Attention/Embedding/共享专家等 Dense 部分(int4 后约 9.9GB)常驻 RAM,1.9 万个路由专家放 NVMe SSD,Router 点名时再按需加载,类比权重的 JIT。
加速手段
- LRU 缓存留住最近使用的专家;统计专家热度提升高频专家缓存优先级。
- 利用相邻层路由相关性(可预测性 71.6%)提前预取下一层专家,计算与 SSD I/O 重叠。
- 支持双 SSD 分摊读取带宽。
实测与配置
- 12 核 CPU + 25GB RAM 冷缓存约 0.05-0.1 token/s;128GB 纯 CPU 约 1.8 token/s;6 张 RTX 5090 可达 5.8-6.8 token/s。
- GLM-5.2 int4 权重约 372GB,最低 16GB RAM 可跑;Kimi K3(2.8T 参数)需约 1.6TB 硬盘、32GB RAM 起步。覆盖 9 个模型家族。
- 提供 Linux/macOS/Windows 预编译版,模型放好后一条 colic chat 即可对话,Web Dashboard 可实时查看专家在各存储层的分布与热度。
「Infra」频道最新
- AI Agent 用 TensorRT 把 Orpheus 3B 推理 RTF 从 1.03 压到 0.87 — TheMoonMidas · 2026-09-27
- TensorFold v0.3.4:M3 Ultra 上 Qwen 27B 解码翻倍至 158 tok/s — TheMoonMidas · 2026-09-27
- 质疑 DeepSeek 华为算力难以盈利,梁文锋 10 个月回本目标存疑 — teortaxesTex · 2026-09-27
- 5千澳元预算如何搭建本地推理主机:二手3090还是AMD新卡 — Smooth-Television-48 · 2026-09-27
- Oracle 触发不可抗力条款,全行业被叫停数据中心达 2000 亿美元 — generativist · 2026-09-27
- 实测 LLM 语义缓存:危险查询反而更像安全查询,多数系统不该上 — bfeeny · 2026-09-27