Transformers 原生支持 GGUF:Qwen3.5-27B 在 M2 Max 反超 llama.cpp
Disastrous-Work-1632 · reddit · 2026-09-23
Hugging Face 的 Aritra 宣布 transformers 现已原生支持 GGUF(llama.cpp 系量化格式),加载后可直接使用常规 Transformers API,便于调试、评测和自定义生成,且量化模型更小、适合笔记本运行。
用法示例:
python
from transformers import AutoModelForCausalLM, AutoTokenizer
modelid = "unsloth/Qwen3.5-4B-GGUF"
model = AutoModelForCausalLM.frompretrained(modelid, gguffile="Qwen3.5-4B-Q4KM.gguf")
在支持的 Apple Silicon 设备上会复用 ggml 内核,直接从打包的量化权重运行。在 M2 Max 上对 Qwen 检查点的实测:
- Qwen3.5-4B Q4KM:70.4 tok/s(llama.cpp 为 71.8)
- Qwen3.8-27B UD-Q4KM:15.9 tok/s,反超 llama.cpp 的 13.4
- Qwen3.5-35B-A3B UD-IQ4XS:60.2 tok/s vs 61.3
作者强调这并非要取代 llama.cpp——追求极致本地推理性能仍推荐 llama.cpp,其价值在于能在更灵活的 PyTorch 生态里使用同一批 GGUF 模型。
所属事件:Transformers 直连 GGML 内核,GGUF 推理追平 llama.cpp(8 条相关)→
「Infra」频道最新
- 硅光芯片晶圆照片引热议:InGaAsP 异构集成相位调制器如何划片 — jwt0625 · 2026-09-23
- 燃气轮机订单排到 2030 年,涨价 195%,补电远水难解近渴 — FinanceYF5 · 2026-09-23
- 2026 年数据中心新增 18GW 需求,算完仍缺约 5GW — FinanceYF5 · 2026-09-23
- 大摩:美国数据中心缺电相当于六个纽约市 — FinanceYF5 · 2026-09-23
- Sail Research 把 Gemma 4 31B 在 TPU v6e 上的 MFU 从 32% 提到 63% — xennygrimmato_ · 2026-09-23
- 马斯克:中国 AI 单位算力表现全球最佳,两三年内破解芯片瓶颈 — XFreeze · 2026-09-23