极客用纯 C99 跑通 Kimi K3:8GB 内存极低配推理
FareedKhan557 · reddit · 2026-08-02
为了在本地机器上把玩超大规模模型,一位开发者用纯 C99 为 Kimi K3(1.56TB)写了一个极简推理引擎,成功在单 CPU 和 8GB 内存的环境下实现了运行。
核心实现思路:
- 按需加载:K3 的 93% 参数为路由专家层,生成单个 token 仅需激活 896 个专家中的 16 个。因此专家层完全不驻留内存,而是直接从 NVMe 按需读取。
- 跳过反量化:读取的 4-bit 打包权重直接进行计算,省去解包步骤。稠密主干层则按已知偏移量打包至单文件,逐层流式读取。
性能表现:
- 在双路 EPYC 7763 测试机上,限制内存占用至最小的 8.24GB 时,速度约为 33 秒/token。
- 分配约 128GB 内存时,速度可达最高 20 秒/token,且各内存档位下的输出结果完全一致。
作者坦言这并非实用的服务方式(需要 1.7TB 磁盘空间且速度极慢),初衷纯粹是为了通过亲手实现架构来深入理解 MoE 模型。整个项目不依赖 BLAS 或任何框架,仅用 6 个 C 文件和 176KB 的二进制文件便完成了壮举。
所属事件:开源引擎让Kimi K3在低配设备上运行(7 条相关)→
「Infra」频道最新
- Tobi 开源 walgit:无数据库的单二进制 Git 服务器 — jevon · 2026-08-24
- s3collections:用S3构建分布式系统持久化数据结构 — andersonbcdefg · 2026-08-24
- 预测市场:年底前美一州实施数据中心禁令概率 68% — Polymarket · 2026-08-24
- Ramp 用本地模型省钱,引发业界对 AI 成本反思 — annetgriffin · 2026-08-24
- GitHub Actions 额度耗尽,是时候迁移到自建 VPS 了吗? — MicahBerkley · 2026-08-24
- Ubuntu 计划成为 RISC-V CPU 的参考操作系统 — bookwormengr · 2026-08-24