Transformers 直连 GGML 内核,GGUF 推理追平 llama.cpp
9 月 22 日,Hugging Face Transformers 核心维护者 Lysandre 宣布库在 GGUF 支持上完成重要升级:得益于工程师 @marcsun 的工作,Transformers 现在可通过 kernels 库在运行时直接调用 GGML 内核,推理性能达到与 llama.cpp 相同的水平。llama.cpp 作者 Georgi Gerganov 也对外宣布了这一消息。
已确认
- Transformers 多年前已支持加载 GGUF 文件,但旧方式是「反量化」,即把量化权重还原,性能明显不如原生量化推理
- 现在通过 kernels 库直接调用 GGML 内核,包括 ggml 的 Metal 内核,性能与 llama.cpp 持平
- llama.cpp 社区产出的大量 GGUF 量化 checkpoint(数百万下载量)可通过熟悉的 frompretrained API 直接加载运行
- Mac 本地推理随之提速
为什么重要
- 用户无需再为运行 GGUF 量化模型单独部署 llama.cpp,在 Transformers 单一生态内即可获得同等性能
- llama.cpp 社区积累的量化模型资产被直接接入 Hugging Face 主力库,降低了本地/边缘推理的使用门槛
2026-09-22 ~ 2026-09-22 · 6 条相关
一手来源
- Transformers 直连 GGML 内核,GGUF 推理性能追平 llama.cpp — LysandreJik ·
- Transformers 现可直接运行 llama.cpp GGUF 量化模型,Mac 本地推理提速 — LysandreJik · 2026-09-22
- Transformers 运行 GGUF 追平 llama.cpp 性能,GGML 内核立功 — LysandreJik · 2026-09-22
- Transformers 直接调用 GGML 内核,性能追平 llama.cpp — LysandreJik · 2026-09-22
- GGUF 模型可直接在 Hugging Face transformers 中运行,Mac 推理提速 — pcuenq · 2026-09-22
另有 2 条近重复转述:LysandreJik · LysandreJik