128GB Strix Halo 跑 Qwen3.6 35B-A3B 稳定 50 tok/s,用户问现在最优解是什么
jankeydankey · reddit · 2026-09-23
一位用户分享了自己的本地部署基线:在 128GB 统一内存的 AMD Strix Halo APU 上,用 Nobara + llama.cpp 跑 Qwen 3.6 35B-A3B Q6 量化,持续约 50 tokens/s,稳定到可以几个月不管。他离开圈子一段时间后求问:有没有同等速度但能力更强、或同等能力但更快的模型,以及当前 128GB Strix Halo 的推荐配置。
「Infra」频道最新
- Unsloth Desktop 热修复:Qwen-Image-2.1 支持图像编辑与量化修复 — danielhanchen · 2026-09-23
- Together AI 上线灰度发布:模型升级不停机,分步切流自动回滚 — togethercompute · 2026-09-23
- 专为大规模运行 Agent 的专用硬件亮相 — cyrilzakka · 2026-09-23
- 三元权重压缩 27B 模型仅 5.9GB,推理能力保留 95% — cephaloform · 2026-09-23
- RTX5090 上 Qwen 27B 跑 24 小时,自主写出完整 Postgres-SpringBoot-React 表格应用 — anglepoiselife · 2026-09-23
- OpenRoboto Shift 发布:众包第一视角视频训练人形机器人大脑 — markjeffrey · 2026-09-23