Transformers 原生支持 GGUF:Qwen3.5-27B 在 M2 Max 反超 llama.cpp

Disastrous-Work-1632 · reddit · 2026-09-23

Hugging Face 的 Aritra 宣布 transformers 现已原生支持 GGUF(llama.cpp 系量化格式),加载后可直接使用常规 Transformers API,便于调试、评测和自定义生成,且量化模型更小、适合笔记本运行。

用法示例:

python

from transformers import AutoModelForCausalLM, AutoTokenizer

modelid = "unsloth/Qwen3.5-4B-GGUF"

model = AutoModelForCausalLM.frompretrained(modelid, gguffile="Qwen3.5-4B-Q4KM.gguf")

在支持的 Apple Silicon 设备上会复用 ggml 内核,直接从打包的量化权重运行。在 M2 Max 上对 Qwen 检查点的实测:

作者强调这并非要取代 llama.cpp——追求极致本地推理性能仍推荐 llama.cpp,其价值在于能在更灵活的 PyTorch 生态里使用同一批 GGUF 模型。

所属事件:Transformers 直连 GGML 内核,GGUF 推理追平 llama.cpp(8 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →