Transformers 现可直接运行 llama.cpp GGUF 量化模型,Mac 本地推理提速
LysandreJik · x · 2026-09-22
Hugging Face 宣布 transformers 新增对 GGUF 格式的高效支持,数百万下载量的 llama.cpp 量化 checkpoint 现在可通过熟悉的 frompretrained API 直接加载运行。
- 兼容性:用户可从 Hub 挑选适配笔记本内存的 GGUF 模型(官方 ggml-org 及 Unsloth、LM Studio Community、bartowski 等均提供多档量化版本)。
- 性能:为追平 llama.cpp 的速度,团队通过 kernels 库复用其底层 ggml 内核,并优化 generate 的开销,首批重点聚焦 Apple Silicon 本地推理。
- 背景:GGUF 是 llama.cpp 团队开发的本地推理格式,支撑 Ollama、LM Studio、Jan 等主流本地 AI 工具。文中还引用了 Julien Chaumond 此前在 MacBook 上用 llama.cpp 跑 Qwen3.6 27B 驱动编码 agent 的演示,称接近最新 Opus 的体验。
「Infra」频道最新
- Cerebras 战略官:安全测试正成为算力厂商的新增长点 — RihardJarc · 2026-09-22
- 拆散实时语音栈成本降 14 倍,意外收获是文本层护栏 — Cloudsurfer_90 · 2026-09-22
- 黄仁勋:吉瓦级 AI 工厂投资高达 50-60 亿美元架构必须可通用 — nvidia · 2026-09-22
- FreeToken 分支支持 DeepSeek-V4.1 与投机解码,2x3090 实测数据公开 — ApeGrower · 2026-09-22
- Bloomberg 视 Nvidia 低市盈率为危险信号,博主反称低估值更诱人 — firstadopter · 2026-09-22
- Eugene Plexus 开源公测:用一个浏览器界面管理多机本地推理 — ScreamingAmish · 2026-09-22