16GB 显存实测:Qwen 27B IQ3 量化比 Bonsai 三元模型快 3 倍

Danmoreng · reddit · 2026-09-19

作者在 16GB VRAM 上对比了两种可本地跑的量化方案:Qwen3.8 27B IQ3XXS(10.18GiB) 与 Bonsai 三元 PQ2(6.42GiB),用同一批 UI 生成任务在相同硬件上测试。

结果两者质量差距不大(4/4 任务完成、20/20 断言通过持平),但效率差距明显:

作者称测试不算严谨,且 llama.cpp 开了 MTP 而 Bonsai 没有,进一步放大了差距。完整结果和仓库已开源。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →