Transformers 直连 GGML 内核,GGUF 推理性能追平 llama.cpp

LysandreJik · x · 2026-09-22

Hugging Face Transformers 此前虽已支持加载 GGUF 文件,但需要先反量化,性能有明显损耗。现在得益于工程师 @marcsun 的工作,Transformers 通过 kernels 库直接调用 GGML 内核运行 GGUF 模型,性能达到与 llama.cpp 相同的水平。作者特别感谢了 GGML 团队提供这些高质量内核。

所属事件:Transformers 直连 GGML 内核,GGUF 推理追平 llama.cpp(6 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →