GGUF 模型可直接在 Hugging Face transformers 中运行,Mac 推理提速
pcuenq · x · 2026-09-22
llama.cpp 作者 Georgi Gerganov 宣布:GGUF 格式模型现在可以在 🤗 transformers 中直接运行。这项工作把 ggml 的 Metal 内核带入了 transformers 生态,让数百万次下载的 llama.cpp 检查点无需转换即可使用,并在 Mac 上借助 ggml 内核获得更快的本地推理性能。
- 同一批模型有了更多运行方式,兼容性和性能同步提升
- 相关博客与 ggml kernels 代码已随发布附上
所属事件:Transformers 直连 GGML 内核,GGUF 推理追平 llama.cpp(6 条相关)→
「Infra」频道最新
- 博主提醒:非美国用户应考虑本地部署 AI,以防政府禁令 — TheMoonMidas · 2026-09-22
- Engram:本地加密记忆库统一各 AI 工具的 agent 记忆 — Acceptable_Leg3950 · 2026-09-22
- DigitalOcean Managed Agents 公测:闲置暂停、按秒计费 — damianplayer · 2026-09-22
- Subconscious 获 510 万美元融资,专做长程 Agent 推理平台 — CShorten30 · 2026-09-22
- Nscale 拟赴美上市估值 350 亿美元,Clegg 或获利 4000 万 — nordicinst · 2026-09-22
- NVIDIA 送出 DGX Spark 首晒:1.2kg 小机身、128GB 统一内存可本地跑 200B 模型 — kimmonismus · 2026-09-22