Transformers 原生支持运行 llama.cpp GGUF 量化模型
ariG23498 · x · 2026-09-29
Hugging Face 官宣 transformers 库新增对 GGUF(llama.cpp 量化格式)的支持:用户可直接从 Hub 选一个 GGUF checkpoint,用 frompretrained 加载,在本机以熟悉的 transformers API 生成。
要点:
- 复用 llama.cpp 底层 ggml 内核(通过 kernels 库)并优化 generate 开销,性能向 llama.cpp 看齐
- 初期优先支持 Apple Silicon 上的本地推理
- Unsloth、LM Studio Community、bartowski 等已提供多种量化档位的现成 GGUF checkpoint,可按机器内存选型
- 还可用 transformers serve 接入 Pi 或 Jan 等本地工具
- 引用 Julien Chaumond 的实测:Qwen3.6 27B 经 llama.cpp 在 MacBook Pro 上跑 Pi 编码 agent,处理 HF 代码库的非平凡任务接近最新 Opus 的体验
这对本地部署和量化模型调试(debug/评测)是重要生态补全。
「Infra」频道最新
- antirez:企业配额用完别慌,自建 DGX Spark 与 Mac Ultra 机群托底 — antirez · 2026-09-29
- Ornith-1.5 三款模型开源 DFlash 投机解码草稿权重 — jacek2023 · 2026-09-29
- 黄仁勋问答称英伟达股票被低估,未来将回购数千亿美元 — firstadopter · 2026-09-29
- Uber Eats 排序模型每秒 800 万次预测,工程团队公开特征一致性方案 — AxSaucedo · 2026-09-29
- Qdrant 推出 Constella 研究预览,换查询嵌入模型无需重建全部向量 — qdrant_engine · 2026-09-29
- 124M 小模型配 65B embedding,研究员戏谑提出 AFED 分离架构 — YouJiacheng · 2026-09-29