Kimi K3 据称可在 8GB CPU 上靠 SSD 流式推理
porAssass · reddit · 2026-08-04
一位 Reddit 用户拆解了一个项目:据称它能把 Kimi K3 跑在普通 CPU 上,甚至只需要 8GB 内存。
- 关键不是把完整的 1.5TB checkpoint 一次性装进内存,而是根本不这么做。
- 利用 MoE 的稀疏性:每个 token 只激活 896 个 expert 中的 16 个。
- expert 权重直接从 NVMe SSD 流式读取,并用 LRU cache 缓存最近使用的 expert。
- 计算直接在压缩后的 MXFP4 权重上完成,而不是先展开。
- 整个推理引擎用可移植 C99 编写,没有依赖 PyTorch、CUDA、TensorRT 甚至 BLAS。
作者也指出,代价是速度很慢,在低内存设备上可能达到每 token 几秒,短期内不可能替代 GPU 推理。但这类思路对未来更大模型的推理系统设计很有启发。
所属事件:开源项目称可用 8GB 内存单 CPU 跑 Kimi K3(2 条相关)→
「Infra」频道最新
- 本地 Qwen 35B 用户求推荐日常任务 Agent 框架 — _n1vk · 2026-08-04
- 爆料称 Rubin Ultra 可能降配 HBM,性能目标不变 — AccBalanced · 2026-08-04
- Exa 称网页索引已达 800 亿页面,2027 年冲击 Google 规模 — garrytan · 2026-08-04
- OpenCode Go 单日处理 6 万亿 token,DeepSeek 占主力 — ycombinator · 2026-08-04
- QwenLM/qwen-code 0.21.5 强化 MCP 安全重放和工具追踪 — qwen-code-ci-bot · 2026-08-04
- QwenLM/qwen-code nightly 继续合入 MCP 安全与桌面迁移修复 — qwen-code-ci-bot · 2026-08-04