176KB C 程序在单 CPU + 8GB 内存上跑 2.78 万亿参数模型
techNmak · x · 2026-09-11
有人写了一个 176 KB 的 C 程序,在只有 8.24 GB 内存的 CPU 上运行 2.78 万亿参数的 Kimi K3,发帖人翻查仓库证实可行——关键是 checkpoint 并未压缩到 8GB,仍是 1.56 TB,靠架构巧妙放置字节实现。
- MoE 是关键:92 个路由层各 896 个专家,每层每 token 只激活 16 个,共 82,432 个路由专家占 1.447 TB(约 93% 的 checkpoint),全部留在 NVMe 上而非内存
- 单专家约 17.56 MB,一个 token 可能跨 92 层需要 1,472 次专家读取;无驻留命中时引擎每 token 约读 25.83 GB 专家权重
- 常驻权重约 113 GB(被作者重排以塞进有限内存),承担持续使用的计算
这是利用 MoE 稀疏性 + NVMe 流式读取实现「穷跑」超大模型的典型案例,对本地部署推理有很强参考价值。
所属事件:单 CPU 加 8.24GB 内存跑通 2.78 万亿参数 Kimi K3(4 条相关)→
「Infra」频道最新
- Together/Fireworks/DeepInfra 的客户到底是谁? — Azamat_Kuzdibay · 2026-09-12
- Reddit 呼吁 llama.cpp 实现 MoE「热专家重载」提速本地推理 — perelmanych · 2026-09-12
- Together 微调服务上新:支持 GLM-5.3、Kimi K2.7-Code,部分降价 30-70% — togethercompute · 2026-09-12
- NVIDIA BioNeMo 跑 3100 万次蛋白质复合物预测,省约 1.35 GWh 能源 — AllThingsApx · 2026-09-12
- Signal65 发布 PINNACLE 基准:按「正确完成的工作量」评测 agentic AI — ryanshrout · 2026-09-12
- DeepSeek 算力被预订一空,加码空间或只剩数据侧 — teortaxesTex · 2026-09-11