纯 C 零依赖引擎 COLIBRI:让消费级硬件跑 2.8T 参数 MoE 模型
bibryam · x · 2026-09-22
开源项目 COLIBRI(GitHub 已 36.9k star)把前沿 MoE 模型(744B 到 2.8T 参数)搬到消费级与异构硬件上运行:纯 C 编写、零引擎依赖,将存储、RAM 和 VRAM 视为统一推理层级(AI 内存多层调度),专家权重从磁盘流式读取。已支持 GLM-5.2/5.3 (744B)、Kimi K3 (2.8T)、DeepSeek V4 系列等九个模型家族。
核心思路是把 MoE 权重当 JIT 代码对待:每个 token 先路由专家,再对 batch 去重,VRAM/RAM 命中运行、NVMe 未命中流式读取,I/O 与计算重叠,并随使用热度调整权重放置。作者注明这是实验性项目,尚未生产可用。
「Infra」频道最新
- 推理机器远多于训练机器:AI 世界里写作将比阅读更便宜 — GregoryDiamos · 2026-09-22
- SayGm 接入 NEAR AI 机密计算:提示词经双重 TEE 证明、双向不可见 — richdotca · 2026-09-22
- Sentdex 实测:openjev 在 GB10 延迟 169ms,3090 上 137ms — Sentdex · 2026-09-22
- PyroDash:小模型按需呼叫大模型,推理成本降96%反超单独用大模型 — jiqizhixin · 2026-09-22
- Underdog 推出 Husky 推理引擎,MacBook 上跑出 730 tokens/s — jimmykoppel · 2026-09-22
- peano_ai 在 1000+ TPU 上对 310B 模型跑通全参数 RL 训练 — simonguozirui · 2026-09-22