25GB 内存跑 744B 模型:Colibri 把专家权重当 JIT 按需加载
thisdudelikesAI · x · 2026-10-07
Colibri 展示了在仅 25GB 内存的笔记本上运行 744B 参数 MoE 模型的方法,核心思路是「不加载,而是放置」:
- MoE 每 token 只激活约 40B 参数,相邻 token 间仅约 11GB 权重变化,无需整模常驻快存
- 稠密部分(注意力、共享专家、embedding)以 int4 留在内存,约 9.9GB
- 19,456 个路由专家(每个约 19MB,共约 370GB)放磁盘,路由命中时才流式读入
- 用前瞻线程预取下一层专家:路由结果一层之外可预测率达 71.6%
- 记录实际使用的专家并钉住最热的,越用越快
作者称之为「权重的 JIT 编译器」,为超大模型在消费级设备部署提供了新路径。
「Infra」频道最新
- 欧洲 AI 短板不止模型:算力基建跟不上数月一代的迭代节奏 — ingliguori · 2026-10-07
- Chrome 155 正式支持 JPEG XL:压缩率比 JPEG 高 30-50% — jedisct1 · 2026-10-07
- 双 7900XTX 跑 27B 模型:等 LPDDR6 新平台还是上 WRX80 — MikeSouto · 2026-10-07
- POC 2026 议题:通过 NVIDIA GPU 驱动逃逸只读容器 — evilsocket · 2026-10-07
- 谷歌发布 SAM:让分散各机的 AI Agent 互发现、互调用工具 — thisguyknowsai · 2026-10-07
- 美光 NVHBM:带宽提升 30%,HBM 功耗降 15% — Ok_Warning2146 · 2026-10-07