27B 4bit 模型 llama.cpp 仅 8-10 t/s,bitsandbytes 反而跑出 27 t/s

cephaloform · x · 2026-10-10

作者实测发现一个反直觉结果:用 llama.cpp 跑 4bit 量化的 27B 模型只有 8-10 tokens/s,而 bitsandbytes + transformers 组合反而达到 27 tokens/s,速度差近 3 倍。作者表示这颠覆了自己的直觉,正在探究原因。

所属事件:实测反直觉:bitsandbytes 跑 4bit 27B 模型比 llama.cpp 快近 3 倍(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →