GGUF 模型可直接在 Hugging Face transformers 中运行,Mac 推理提速

pcuenq · x · 2026-09-22

llama.cpp 作者 Georgi Gerganov 宣布:GGUF 格式模型现在可以在 🤗 transformers 中直接运行。这项工作把 ggml 的 Metal 内核带入了 transformers 生态,让数百万次下载的 llama.cpp 检查点无需转换即可使用,并在 Mac 上借助 ggml 内核获得更快的本地推理性能。

所属事件:Transformers 直连 GGML 内核,GGUF 推理追平 llama.cpp(6 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →