Mac Studio 本地跑 27B 模型实测

MaziyarPanahi · x · 2026-07-15

- 这条帖子展示了在 **Mac Studio** 上运行 **prism-ml/Ternary-Bonsai-27B-gguf** 的实践:通过 **Hugging Face Inference Providers**,由 **Together AI** 托管服务。作者强调“没有 Mac Studio 也能用同一模型”,指向的是推理服务化而非单机硬件依赖。 - 引用内容补充了更完整的场景:模型在本地用 **llama.cpp + Metal** 运行,体积约 **7.2GB**、协议为 **Apache-2.0**,并在一份包含 **292 次就诊记录**、约 **3 年**的患者病历上工作。 - 这次测试里,**GLM-5.2** 只能提问,Bonsai 负责回答;模型在约 **2 秒**内回答了 3 个问题,且当时还保留了 **19,398 tokens** 的缓存。作者还称它最终发现了一个埋了 **17 个月** 的问题,强调了长上下文与本地隐私场景的实用性。

所属事件:Mac Studio本地运行27B模型处理长病历(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →