Transformers 运行 GGUF 追平 llama.cpp 性能,GGML 内核立功
LysandreJik · x · 2026-09-22
Hugging Face 核心维护者 Lysandre 宣布 Transformers 库在 GGUF 支持上的重要升级:
- Transformers 多年前已能加载 GGUF 文件,但方式是「反量化」(unquantizing),即把量化模型还原后运行,性能有损失。
- 得益于开发者 @marcsun 的贡献,现在通过 kernels 库直接调用 GGML 内核运行 GGUF 模型,性能已与 llama.cpp 持平。
- 作者特别感谢 ggmlorg 团队制作了这些内核。
所属事件:Transformers 直连 GGML 内核,GGUF 推理追平 llama.cpp(6 条相关)→
「Infra」频道最新
- 本地跑 H3 视频:15 秒生成 5 分钟零成本,对比平台每次约 0.6 美元 — AIandDesign · 2026-09-22
- MotherDuck 文本分类提速 50 倍,成本降至 1% — josh_wills · 2026-09-22
- Google 月处理 3200 万亿 token 约耗 12GW,三年内或撞能源墙 — victor_explore · 2026-09-22
- M5 Ultra 256GB 首测 Mimo2.6-Flash:32K 上下文 49 tok/s — bakawolf123 · 2026-09-22
- TRL 异步 GRPO 支持 LoRA,训练 500 步耗时从 3.5 小时降至 53 分钟 — SergioPaniego · 2026-09-22
- GGUF 模型可直接在 Hugging Face transformers 中运行,Mac 推理提速 — pcuenq · 2026-09-22