128GB Strix Halo 跑 Qwen3.6 35B-A3B 稳定 50 tok/s,用户问现在最优解是什么

jankeydankey · reddit · 2026-09-23

一位用户分享了自己的本地部署基线:在 128GB 统一内存的 AMD Strix Halo APU 上,用 Nobara + llama.cpp 跑 Qwen 3.6 35B-A3B Q6 量化,持续约 50 tokens/s,稳定到可以几个月不管。他离开圈子一段时间后求问:有没有同等速度但能力更强、或同等能力但更快的模型,以及当前 128GB Strix Halo 的推荐配置。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →