Transformers 原生支持 GGUF:llama.cpp 量化模型可直接加载推理
ariG23498 · x · 2026-09-23
Hugging Face 官宣 transformers 库现已原生支持运行 GGUF 模型,用熟悉的 frompretrained API 就能加载 llama.cpp 生态的量化权重,在本地机器上生成。
- 背景:GGUF 是 llama.cpp 团队开发的本地推理格式,Ollama、LM Studio、Jan 等工具都基于其引擎;Unsloth、bartowski 等发布者在 Hub 上提供了大量现成 GGUF 检查点,下载量已达数百万次
- 性能:为接近 llama.cpp 的速度,团队通过 kernels 库复用其底层 ggml 内核,并优化了 generate 的开销,初期聚焦 Apple Silicon 本地推理
- 意义:llama.cpp 生态与 transformers/HF 生态打通,笔记本内存大小的模型可直接用 transformers 工作流跑
文中还引用 Julien Chaumond 的演示:Qwen3.6 27B 在 MacBook Pro 上通过 llama.cpp 跑进 Pi coding agent,效果接近最新 Opus。
所属事件:Transformers 直连 GGML 内核,GGUF 推理追平 llama.cpp(8 条相关)→
「Infra」频道最新
- Sail Research 把 Gemma 4 31B 在 TPU v6e 上的 MFU 从 32% 提到 63% — xennygrimmato_ · 2026-09-23
- 马斯克:中国 AI 单位算力表现全球最佳,两三年内破解芯片瓶颈 — XFreeze · 2026-09-23
- 复用连接把 LLM 调用前预算检查 p99 从 1278ms 降到 414ms — Tough_Stretch_4045 · 2026-09-23
- AI 基建回本没那么难:已投运资本收入覆盖 121%,远期要求降至 44% — FinanceYF5 · 2026-09-23
- Transformers 原生支持 GGUF:Qwen3.5-27B 在 M2 Max 反超 llama.cpp — Disastrous-Work-1632 · 2026-09-23
- 高盛:2026 美中 AI 资本开支差 7 倍,中国靠效率追赶 — FinanceYF5 · 2026-09-23