本地跑 Qwen 35B:32GB Mac 提示词处理慢至 20 分钟求升级方案
Guilty-Support-584 · reddit · 2026-09-16
Reddit 用户咨询本地部署硬件选型:现有 M2 Max 32GB MacBook 跑 Qwen3.6 35B A3B(q4,18GB)+60k 上下文明显吃力,会触发 swap;纯 SSD 流式仅 4-10 tks;全载入 RAM 后 15-20 tks,但 40-60k token 的 prompt 处理仍需 20-60 分钟。候选方案为 €1500 二手 M1 Max 64GB、€3500 M3 Max 128GB,或自组 24GB 显卡 + 128GB RAM 的 PC。目标是在合理价位以可用速度跑最强本地模型,评论在讨论各方案能跑的模型规格与预期速度。
「Infra」频道最新
- 面向 8GB 级设备的开源小模型榜单:SmolLM2-135M 达 165 tok/s、29.6 tok/J — East-Muffin-6472 · 2026-09-16
- Ministral 3 3B 纯 CPU 跑在 Galaxy S21 上,10 次全成跨双浏览器转发对话 — Mean-Standard7390 · 2026-09-16
- llama.cpp 合入 hc 算子优化 Qwen4exp,可重新跑分 — jacek2023 · 2026-09-16
- 腾讯开源 BrowserSkill:让 AI Agent 复用你已登录的真实浏览器 — AIFlow_ML · 2026-09-16
- 先存全部历史再按需构建视图:数据湖仓式上下文基础设施模式浮现 — blaizedsouza · 2026-09-16
- Lumentum:FDA 光学进入 30 年最大拐点,光互联将成算力引擎一部分 — pstAsiatech · 2026-09-16