Transformers 接入 GGML 内核,性能追平 llama.cpp
LysandreJik · x · 2026-09-22
Hugging Face 的 LysandreJik 宣布 Transformers 现在可通过 kernels 库直接调用 GGML 内核运行模型,达到与 llama.cpp 相同的性能,而不再只是加载 GGUF 文件后反量化。目前作为概念验证支持 Qwen 3.5 及其 MoE 版本两种架构。
更值得关注的方向:即使模型不在 llama.cpp 支持列表内,也能复用其 GGML 内核。对于 CV、diffusion、TTS 等本身需要大量前后处理、难以直接接入 llama.cpp 的模态,可以绕开 GGUF 文件格式直接借用这些高性能内核,目前仍处于概念验证阶段但前景可观。GGML 内核已托管在 HF Hub 的 GGML org 下。
所属事件:Transformers 直连 GGML 内核,GGUF 推理追平 llama.cpp(6 条相关)→
「Infra」频道最新
- Unsloth 量化让 Qwen-Image-2.1 仅需 6GB 显存本地运行 — danielhanchen · 2026-09-23
- DGX Spark 实机开箱:15cm 见方、1.2kg、128GB 统一内存 — socialwithaayan · 2026-09-23
- H Company 用 SkyPilot 训练 computer-use 模型,沙盒秒级冷启动 — skypilot_org · 2026-09-23
- MiniMax H3 上跑 M5 Ultra 实测:768p 视频约 2 分 22 秒生成 — bakawolf123 · 2026-09-22
- Cisco 预测:Agentic AI 将令企业流量十年增长 9 倍 — Beth_Kindig · 2026-09-22
- Cloudflare 全套餐支持 HTTP 缓存规则中的 Vary 头 — threepointone · 2026-09-22