Transformers 原生支持 GGUF:llama.cpp 量化模型可直接加载推理

ariG23498 · x · 2026-09-23

Hugging Face 官宣 transformers 库现已原生支持运行 GGUF 模型,用熟悉的 frompretrained API 就能加载 llama.cpp 生态的量化权重,在本地机器上生成。

文中还引用 Julien Chaumond 的演示:Qwen3.6 27B 在 MacBook Pro 上通过 llama.cpp 跑进 Pi coding agent,效果接近最新 Opus。

所属事件:Transformers 直连 GGML 内核,GGUF 推理追平 llama.cpp(8 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →