纯 C 写的推理引擎让 32GB 无 GPU 笔记本跑 230B MoE 模型
WritHerAI · reddit · 2026-10-06
- 开发者开源了名为 Picchio 的纯 C 推理引擎(MIT 协议),专为「模型大于内存」的 MoE 模型设计:稠密部分常驻内存,专家权重按需从 SSD 流式读取,并对高频专家做缓存,思路源自 Colibri。
- 最新适配 MiniMax-M2(230B):INT4 量化后约 122 GB,几乎全部从磁盘流式加载。
- 在 12 核、32 GB 内存、普通 NVMe、无 GPU 的笔记本上,配 20 GB 专家缓存可达约 0.48 tok/s——很慢但能跑。实测发现缓存大小是唯一真正重要的因素。
- 正确性方面:与 MiniMax 官方代码在小测试模型上对比,前向输出一致(最大 logit 差约 1e-6)。
- 局限:若有 128 GB 内存或好 GPU,llama.cpp 会快得多;仅在 Windows + Intel CPU 上测试,未覆盖 M2.5/M3。
「Infra」频道最新
- 6 秒转录 1 小时语音:Phonon-2 Core ML 版达 606 倍实时,内存砍至 1.1GB — julianweisser · 2026-10-07
- Mistral Large 4 仅用 4000 块 GPU 训练,竞品 Astra 用了 10 万块 — steipete · 2026-10-07
- SpaceX 曝百万卫星 Starlink 算力架构:10 星成组、组内 10T 带宽 — XFreeze · 2026-10-07
- Google EmbeddingGemma 2 已可在浏览器内经 WebGPU 本地运行 — xenovatech · 2026-10-07
- AI 找到的安全漏洞激增,OpenSSH 改为更频繁发版 — jedisct1 · 2026-10-07
- Lambda 推出 AIPerf:衡量模型在真实用户负载下的表现 — TheZachMueller · 2026-10-07