Mac本地大模型多用户部署实战:如何突破并发瓶颈

Spanky2k · reddit · 2026-08-04

作者分享了在 64GB M1 Ultra Mac Studio 上为多用户部署本地大模型的经验。目前使用 LM Studio 配合 open-webui,但面临多用户并发时需重复处理历史提示词的瓶颈。

作者探讨了转向 vLLM 的可能性,但指出其缺乏对 Mac MLX 模型的良好支持,而 vllm-metal 等替代方案尚不成熟。为优化性能,作者计划将 Qwen 3.6 模型从 8-bit 降级为 4-bit,以换取最高 26.2 万的上下文长度和更快的响应速度,从而更好地支持 2-3 名用户的日常并发请求。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →