本地 LLM 推理:除了 llama.cpp 还有更快引擎吗?

PoshoZen11 · reddit · 2026-08-24

用户在 Mac 上运行本地 LLM,发现 Ollama 较慢,切换到 llama.cpp 后性能有所提升。现寻求比 llama.cpp 更快或更优化的替代方案,特别是关于推理引擎、GPU/CPU 优化、KV-cache、卸载和推测解码等方面的建议(排除量化建议)。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →