exllamav3 CPU offload 实测:Qwen 预填快 3.2 倍解码快 2 倍
Lowkey_LokiSN · reddit · 2026-09-08
- 作者用 2×RTX 3080 20GB + 128GB DDR4 + Xeon 6148 对比 llama.cpp 与 exllamav3 的 CPU-offload 推理:Qwen-3.8-Flash-Next 上 llama.cpp(Unsloth Q4KXL)约 270tps 预填、13tps 解码且随上下文衰减。
- exllamav3 的 4.05 EXL3 量化平均解码 25tps(峰值 32tps),稳定保持到 160k 上下文,预填 870tps,快 3.2 倍,量化质量也更好。
- 但优势不通用:GLM 5.3 Flash 的 EXL3 反而比 llama.cpp 慢约 2 倍,瓶颈在 CPU 的 AVX2;效果依赖模型架构与硬件。
- 实操提示:exllamav3 + TabbyAPI 配置比 llama.cpp 复杂;解码速度需数千 token 预热(校准冷热专家),从 12tps 逐步爬到 25-30tps,别过早下结论。
「Infra」频道最新
- 一篇长文构建分布式计算统一心智模型:K8s、Slurm、Ray、Spark — ArchitectingAI · 2026-09-08
- Aurora 网关修复 OpenCode API 更新引发的 HTTP 400 报错 — entitybtw · 2026-09-08
- NVIDIA 推出免费工具,把个人电脑变成专属 AI 数据中心 — ohiocodernumerouno · 2026-09-08
- 网友实测称 ExLlamaV3 被低估:同体积量化质量更高、更快 — Embarrassed_Soup_279 · 2026-09-08
- 自研 CPU 推理引擎跑 Qwen3.5 0.8B:比 llama.cpp 快 2.9 倍 prefill — Danmoreng · 2026-09-08
- 韩国拟向全民免费开放无限量 AI,推理将成为公共基础设施 — AccBalanced · 2026-09-08