llama.cpp 优化:Metal 后端提速 12.7%

predatar · reddit · 2026-09-01

作者提交了一个针对 llama.cpp 的 Metal 后端优化 PR,旨在提升 Apple Silicon 上 IQ3XXS 模型的解码速度。在测试工作负载中,TieL Coder 35B A3B 模型的解码速度从 65.6 tok/s 提升至 73.9 tok/s。作者邀请社区测试并分享对比数据,并预告后续将有针对 prefill 阶段的优化。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →