llama.cpp 增加 Q8_0 支持

pmttyji · reddit · 2026-07-15

ggml-zendnn 为 llama.cpp 增加了 Q80 量化支持,并在多组模型上对比了 GGML CPU 与 ZenDNN 的吞吐表现。

结果要点

代表性数据

结论

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →