llama.cpp 新 PR 让 Metal 上投机解码提速 3 倍

pmttyji · reddit · 2026-10-06

llama.cpp 的一个 Metal PR 为少行矩阵乘与批量拷贝做了优化,专为 Apple Silicon 上的投机解码(DFlash2)服务。实测 Qwen3.8-27B 配 DFlash2 drafter:代码场景解码从 30.2 tok/s 提升到 110.0 tok/s,散文场景从 16.8 提升到 62.6 tok/s,而在普通串行解码下开销几乎为零。Apple 设备本地跑大模型的用户值得关注。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →