实测反直觉:bitsandbytes 跑 4bit 27B 模型比 llama.cpp 快近 3 倍
开发者 cephaloform 在用强化学习做内核优化时得到一个反直觉的实测结果:在自己的硬件上采样 4bit 量化的 27B 模型,llama.cpp 仅能跑出 8-10 tokens/s,而 vanilla transformers + bitsandbytes 反而达到 27 tokens/s,速度接近前者的 3 倍,成为其场景下的最优选择。这一发现颠覆了「llama.cpp 量化推理更快」的普遍认知,也提示实际选型应以自身硬件实测为准。
2026-10-10 ~ 2026-10-10 · 2 条相关
- 27B 4bit 模型 llama.cpp 仅 8-10 t/s,bitsandbytes 反而跑出 27 t/s — cephaloform · 2026-10-10
- 反直觉实测:4bit 27B 模型 bitsandbytes+transformers 反比 llama.cpp 快近 3 倍 — cephaloform · 2026-10-10