自研 CPU 推理引擎跑 Qwen3.5 0.8B:比 llama.cpp 快 2.9 倍 prefill
Danmoreng · reddit · 2026-09-08
Reddit 用户 Danmoreng 用 Codex 在周末写了一个 C++ 推理引擎和自定义 4-bit 量化格式 H128/Q4-G32-DOT4,带激活校准与分块误差补偿,用于在 CPU 上跑 Qwen3.5 0.8B(用途是 GPU 被占用时的本地语音听写清理模型)。
- 模型权重 425 MB,比 Unsloth 混合精度 Q40 小约 71 MB,困惑度与 KL 散度相当
- 在 Ryzen 9 9955HX3D(8 个 V-Cache 物理核)上对比 llama.cpp 的 Q40:prefill 快约 2.9 倍、单请求 decode 快 1.3 倍、batch-16 吞吐高 1.7 倍
- 对比 ikllama.cpp 同款 GGUF:单请求 decode 快 18%,batch-16 吞吐高 53%
- 代码开源于 GitHub:Danmoreng/qwen35-cpu
「Infra」频道最新
- 预测市场开出 74% 概率:年内将有美国州立法暂停新建数据中心 — Polymarket · 2026-09-08
- 丹佛数据中心被拍到大面积浇草坪,150万居民却限水抗旱 — Polymarket · 2026-09-08
- 一篇长文构建分布式计算统一心智模型:K8s、Slurm、Ray、Spark — ArchitectingAI · 2026-09-08
- Aurora 网关修复 OpenCode API 更新引发的 HTTP 400 报错 — entitybtw · 2026-09-08
- NVIDIA 推出免费工具,把个人电脑变成专属 AI 数据中心 — ohiocodernumerouno · 2026-09-08
- 网友实测称 ExLlamaV3 被低估:同体积量化质量更高、更快 — Embarrassed_Soup_279 · 2026-09-08