Reddit 求实测:128GB M5 Max Mac Studio 能扛住多智能体本地推理吗
Simple_Telephone_867 · reddit · 2026-10-06
一位 Reddit 用户订购了 M5 Max Mac Studio(18 核 CPU/40 核 GPU/128GB 统一内存),想找到这一具体配置跑本地 LLM 的真实数据,却发现网上几乎全是 Ultra 或低配版本的内容。他计划将其用作本地智能体工作站:多个自主智能体长期并发运行,常规任务交给本地模型,复杂推理升级到云端。他向同配置用户征集八方面经验:实际运行哪些模型(如 Qwen 27B 级别)、token 速度、3-5 个智能体并发请求同一模型时的吞吐与响应、多模型同时加载与切换的延迟、长时间 6-12 小时连续推理是否降频、实际瓶颈在内存容量/带宽/KV cache 还是算力等。到货后他计划自行测试并发场景并公布内存占用、上下文长度、聚合与单智能体 tok/s 等数据。
「Infra」频道最新
- 网友算账:大模型订阅价被补贴,MiniMax 推理毛利高达七八成 — menhguin · 2026-10-06
- 前沿实验室约 90% 算力已投向后训练与推理 — IanAndrewsDC · 2026-10-06
- KLIF 开源:一个窗口统一管理 llama.cpp、vLLM 等本地推理服务器 — Koksny · 2026-10-06
- 双 RX 7900 XT 跑 Qwen 27B 实测:单流最高 66.5 TPS,离网传 100+ 差多远 — EqualCryptographer67 · 2026-10-06
- 开发者晒 3 万亿 token 用量:9 月烧掉 842B,API 牌价 40.9 万美元订阅仅付 3.4% — doodlestein · 2026-10-06
- 一个 Dot 每天烧 16 亿 token:100 美元订阅跑出月均 54 万美元 API 等价成本 — DarthSilent · 2026-10-06