Reddit 求实测:128GB M5 Max Mac Studio 能扛住多智能体本地推理吗

Simple_Telephone_867 · reddit · 2026-10-06

一位 Reddit 用户订购了 M5 Max Mac Studio(18 核 CPU/40 核 GPU/128GB 统一内存),想找到这一具体配置跑本地 LLM 的真实数据,却发现网上几乎全是 Ultra 或低配版本的内容。他计划将其用作本地智能体工作站:多个自主智能体长期并发运行,常规任务交给本地模型,复杂推理升级到云端。他向同配置用户征集八方面经验:实际运行哪些模型(如 Qwen 27B 级别)、token 速度、3-5 个智能体并发请求同一模型时的吞吐与响应、多模型同时加载与切换的延迟、长时间 6-12 小时连续推理是否降频、实际瓶颈在内存容量/带宽/KV cache 还是算力等。到货后他计划自行测试并发场景并公布内存占用、上下文长度、聚合与单智能体 tok/s 等数据。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →