突破虚拟化限制,Apple Silicon 跑 LLM 推理提速 16 倍

petrusenko_max · x · 2026-08-12

开发者在 Apple Silicon macOS 虚拟机(VM)内引入了一个自定义兼容层,通过调用更新的 Metal GPU 内核,大幅提升了 llama.cpp 的本地大模型推理速度。

测试显示,推理速度最高提升了 11 至 16 倍。在 M1 Ultra 芯片上运行 TinyLlama 模型时,其提示词处理速度达到了裸机运行水平的 98%。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →