llama.cpp 连发三个 Metal MoE 优化 PR,M5 上解码提速 12%

predatar · reddit · 2026-09-03

一位 M5 MacBook Pro 用户为避免本机跑大模型过热,向 llama.cpp 提交了 3 个 Metal 后端优化 PR,并在 Reddit 征集更多机型(尤其 Qwen3.8-Flash-Next)的测试者:

作者建议用 llama-bench -m model.gguf -p 4096 -n 64 -ub 512 对比 master 与 PR 分支的成绩。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →