Transformers 直连 GGML 内核,GGUF 推理性能追平 llama.cpp
LysandreJik · x · 2026-09-22
Hugging Face Transformers 此前虽已支持加载 GGUF 文件,但需要先反量化,性能有明显损耗。现在得益于工程师 @marcsun 的工作,Transformers 通过 kernels 库直接调用 GGML 内核运行 GGUF 模型,性能达到与 llama.cpp 相同的水平。作者特别感谢了 GGML 团队提供这些高质量内核。
所属事件:Transformers 直连 GGML 内核,GGUF 推理追平 llama.cpp(6 条相关)→
「编程与Agent」频道最新
- 25 个 PM 岗位近半要求会写 evals,四家公司晒 eval 投入回报数据 — lennysan · 2026-09-22
- Navier-Stokes 偏正则性定理被 agent 集群 36 小时内用 Lean 形式化 — RexDouglass · 2026-09-22
- 5 个开源仓库教会你的 Agent 模型做不到的事 — 0xsachi · 2026-09-22
- JetBrains 发布 Air:面向智能体开发的多产品协同体系 — rseroter · 2026-09-22
- ruff 作者用 Codex 一天清理约 30 个过期 issue — charliermarsh · 2026-09-22
- 16 年资深开发者自述:2026 年一行代码没写,全靠 agent — thehumanbagelman · 2026-09-22