纯CPU跑通 Kimi K3:自研 Q3 量化占用 1.1TB,速度达 4.2 t/s
Fun-Meaning-6474 · reddit · 2026-07-30
开发团队使用定制的 llama.cpp 分支,成功将 Kimi K3(总参数 2.8T,激活 50B)量化为 GGUF 格式。目前 Q3KS 版本已跑通,占用磁盘空间约 1114.76 GiB。
硬件配置与性能:
- 租用了一台无 GPU 的服务器,配备 AMD EPYC 9554P (64核)、1.5TB DDR5 内存以及组 RAID 0 的 NVMe 硬盘。
- 使用 110 线程运行时,Prefill 512 tokens 的速度为 4.21 t/s。
质量测试:
团队对该量化版本进行了文本连贯性和图像理解测试。例如输入1969年人类登月的《纽约时报》头版图片,模型能准确列出报头、标语、日期、头条及子标题等细节,未出现明显幻觉。团队借此探讨了一个思路:与其选择参数小但速度快的模型,是否值得在 CPU 上运行这种超大型量化模型。
「Infra」频道最新
- ThunderAgent 引擎实测:吞吐量翻倍,多节点扩展近乎线性 — togethercompute · 2026-07-30
- ICML 2026 Spotlight:ThunderAgent实现2倍智能体推理加速 — togethercompute · 2026-07-30
- ICML 2026 论文 ThunderAgent:解决智能体推理 KV 缓存抖动 — togethercompute · 2026-07-30
- QuixiCore-ROCm 开源:专为 AMD MI300x 优化的高性能 Kernel 库 — QuixiAI · 2026-07-30
- QuixiAI 展示在 AMD MI300X 上运行模型的优化方案:支持 gguf 和自定义 HIP 内核 — QuixiAI · 2026-07-30
- QuixiAI开源SlimServe:基于AMD MI300X加速GLM推理 — QuixiAI · 2026-07-30