Transformers 接入 GGML 内核,性能追平 llama.cpp

LysandreJik · x · 2026-09-22

Hugging Face 的 LysandreJik 宣布 Transformers 现在可通过 kernels 库直接调用 GGML 内核运行模型,达到与 llama.cpp 相同的性能,而不再只是加载 GGUF 文件后反量化。目前作为概念验证支持 Qwen 3.5 及其 MoE 版本两种架构。

更值得关注的方向:即使模型不在 llama.cpp 支持列表内,也能复用其 GGML 内核。对于 CV、diffusion、TTS 等本身需要大量前后处理、难以直接接入 llama.cpp 的模态,可以绕开 GGUF 文件格式直接借用这些高性能内核,目前仍处于概念验证阶段但前景可观。GGML 内核已托管在 HF Hub 的 GGML org 下。

所属事件:Transformers 直连 GGML 内核,GGUF 推理追平 llama.cpp(6 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →