实测反直觉:bitsandbytes 跑 4bit 27B 模型比 llama.cpp 快近 3 倍

开发者 cephaloform 在用强化学习做内核优化时得到一个反直觉的实测结果:在自己的硬件上采样 4bit 量化的 27B 模型,llama.cpp 仅能跑出 8-10 tokens/s,而 vanilla transformers + bitsandbytes 反而达到 27 tokens/s,速度接近前者的 3 倍,成为其场景下的最优选择。这一发现颠覆了「llama.cpp 量化推理更快」的普遍认知,也提示实际选型应以自身硬件实测为准。

2026-10-10 ~ 2026-10-10 · 2 条相关