27B 4bit 模型 llama.cpp 仅 8-10 t/s,bitsandbytes 反而跑出 27 t/s
cephaloform · x · 2026-10-10
作者实测发现一个反直觉结果:用 llama.cpp 跑 4bit 量化的 27B 模型只有 8-10 tokens/s,而 bitsandbytes + transformers 组合反而达到 27 tokens/s,速度差近 3 倍。作者表示这颠覆了自己的直觉,正在探究原因。
所属事件:实测反直觉:bitsandbytes 跑 4bit 27B 模型比 llama.cpp 快近 3 倍(2 条相关)→
「Infra」频道最新
- Joseph Jacks:模拟神经网络会巨大成功,大脑早已如此 — JosephJacks_ · 2026-10-10
- Baseten 携手 Goodfire 推 Project Beacon,开源模型默认带安全监控 — baseten · 2026-10-10
- The Information:Nvidia 拟投资芯片对手 d-Matrix,收编挑战者 — pstAsiatech · 2026-10-10
- Prime Agent 调度 2000 个智能体用 Rust 重写自身,输入提速 13 倍 — xeophon · 2026-10-10
- Nathan Lambert:AI 将快速进步,但不会通向全面超级智能 — Interconnects (Nathan Lambert) · 2026-10-10
- Tinker 宣布最高降价 70%,GLM-5.3-Flash 与 DeepSeek-v4.1-Flash 上线 — soumithchintala · 2026-10-10