反直觉实测:4bit 27B 模型 bitsandbytes+transformers 反比 llama.cpp 快近 3 倍

cephaloform · x · 2026-10-10

开发者 cephaloform 在用 RL 做内核优化时发现反直觉结果:在自己的硬件上采样,vanilla transformers + bitsandbytes 反而是最优选择——4bit 量化 27B 模型,bitsandbytes + transformers 达到 27 tokens/s,而 llama.cpp 只有 8-10 tokens/s,相差近 3 倍。

作者自嘲这完全颠覆了自己的直觉(通常 llama.cpp 被认为是更快的推理方案),也在思考原因。对需要在自家硬件上做采样/RL 的人是有参考价值的实测数据点。

所属事件:实测反直觉:bitsandbytes 跑 4bit 27B 模型比 llama.cpp 快近 3 倍(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →