自研 CPU 推理引擎跑 Qwen3.5 0.8B:比 llama.cpp 快 2.9 倍 prefill

Danmoreng · reddit · 2026-09-08

Reddit 用户 Danmoreng 用 Codex 在周末写了一个 C++ 推理引擎和自定义 4-bit 量化格式 H128/Q4-G32-DOT4,带激活校准与分块误差补偿,用于在 CPU 上跑 Qwen3.5 0.8B(用途是 GPU 被占用时的本地语音听写清理模型)。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →