一人开发 Colibri 推理引擎:25GB 内存笔记本跑 2.8T 参数模型
alex_verem · x · 2026-08-16
开发者 alexverem 介绍了一个名为 Colibri 的开源推理引擎,它能在 12 核、25GB 内存的笔记本上运行高达 2.8 万亿参数的 AI 模型。该项目在 GitHub 上已获 24.8k 星标。
Colibri 利用 MoE 模型的稀疏激活特性(如 GLM-5.2 有 7440 亿参数,但每次只激活约 400 亿),将硬盘、内存和显存统一为分层存储,按需从磁盘流式加载专家模块,并缓存常用部分以加速。引擎为纯 C 实现,无外部依赖,无需 GPU 也能运行。
性能方面:在 6 块 RTX 5090 上可达 5.8 tokens/s(744B 模型),单笔记本 GPU 约 1 token/s,原始 25GB 机器上约 0.1 token/s。
「Infra」频道最新
- 新协议压缩 agent 历史 71.9%,欲让树莓派跑 3B 模型 — Parallel_News · 2026-08-16
- 开发者探究 B200 是否存在未文档化加速指令 — SkyLi0n · 2026-08-16
- 从零手写NVFP4内核,GB300上超cuBLAS 4.7% — pranjalssh · 2026-08-16
- Qwen 3.8 登 Apple Silicon,社区提速超 150% — gajesh · 2026-08-16
- a16z:NeoClouds 正复刻铁路转光纤的基础设施剧变 — a16z · 2026-08-16
- OpenAI 预览 GPT-5.6 Sol 超快模式:Cerebras 赋能提速 14 倍 — Justgototheeffinmoon · 2026-08-16