本地 LLM 推理:除了 llama.cpp 还有更快引擎吗?
PoshoZen11 · reddit · 2026-08-24
用户在 Mac 上运行本地 LLM,发现 Ollama 较慢,切换到 llama.cpp 后性能有所提升。现寻求比 llama.cpp 更快或更优化的替代方案,特别是关于推理引擎、GPU/CPU 优化、KV-cache、卸载和推测解码等方面的建议(排除量化建议)。
「Infra」频道最新
- Hugging Face Diffusers 更新 CLI,为 Agent 优化推理成本 — RisingSayak · 2026-08-24
- Claude 故障频发遭质疑,8 月超半数天数报错 — heypearlai · 2026-08-24
- Anthropic 拒绝公开 Max 订阅用量限制,用户实测揭秘计费逻辑 — Ohtince · 2026-08-24
- 把 SQLite 数据库当作可执行文件运行的 Linux 技巧 — Simon Willison · 2026-08-24
- 老旧迷你主机外挂 3060,跑出惊人效果 — neochrome · 2026-08-24
- 别再吹 Worktree 是 AI 编码安全解药了 — Creamy-And-Crowded · 2026-08-24