16GB 显存实测:Qwen 27B IQ3 量化比 Bonsai 三元模型快 3 倍
Danmoreng · reddit · 2026-09-19
作者在 16GB VRAM 上对比了两种可本地跑的量化方案:Qwen3.8 27B IQ3XXS(10.18GiB) 与 Bonsai 三元 PQ2(6.42GiB),用同一批 UI 生成任务在相同硬件上测试。
结果两者质量差距不大(4/4 任务完成、20/20 断言通过持平),但效率差距明显:
- 总耗时 8:00 vs 24:09,Qwen 快 3.02 倍
- 输出 token 27,197 vs 84,176,Qwen 省 3.1 倍(Bonsai 更啰嗦导致更慢)
- 解码速度 83.59 vs 64.91 tok/s;投机解码接受率 65.22%(MTP)vs 39.76%(修改版 N-gram)
作者称测试不算严谨,且 llama.cpp 开了 MTP 而 Bonsai 没有,进一步放大了差距。完整结果和仓库已开源。
「Infra」频道最新
- 跑 Emacs 刷 X 的自建主机现比汽车还贵,GPU 涨价梗图走红 — tetsuoai · 2026-09-19
- M4 每周期可执行 10 条指令,超多数竞品,M5 提速另有玄机 — lemire · 2026-09-19
- Apple M6 核心数增至12,作者解析CPU仍在快速进步 — lemire · 2026-09-19
- Apple M2 到 M5 三年性能提升约 50%, gradual 无跳跃式增长 — lemire · 2026-09-19
- OpenAI 揭秘推理路由:比例控制器为何换成全局优化器 — AI Engineer · 2026-09-19
- DGX Spark 双机太贵,本地 AI 硬件 affordability 引热议 — FlolightC · 2026-09-19