Transformers 直接调用 GGML 内核,性能追平 llama.cpp

LysandreJik · x · 2026-09-22

Hugging Face 的 Lysandre(Transformers 维护者)宣布:Transformers 已可在运行时通过 kernels 库直接使用 GGML 内核,性能达到与 llama.cpp 相同的水平——此前 Transformers 虽已支持加载 GGUF 文件(需反量化),但性能有差距。目前作为概念验证仅支持 Qwen 3.5 及其 MoE 版本,欢迎到 issues 提名想支持的模型。

更令人兴奋的方向是:即便模型不在 llama.cpp 支持列表内、甚至没有 GGUF 文件,也能复用 GGML 内核。对 LLM 而言 llama.cpp 覆盖已足够广,但原始 CV、扩散模型、TTS 等需要大量前后处理的模态,直接借用 GGML 内核尤其有价值。项目仍在 PoC 阶段,但前景可观。

所属事件:Transformers 直连 GGML 内核,GGUF 推理追平 llama.cpp(6 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →