gufo-Qwen3.6-35B 本地实测:Strix Halo 上 3095 tok/s 预填充

nubela · reddit · 2026-10-03

Reddit 用户分享 gufo-Qwen3.6-35B-A3B-Q6dense 量化模型在 AMD Strix Halo 平台上的本地推理成绩:prefill 达 3095 tok/s,decode 约 190 tok/s。项目已在 GitHub 开源,对关注消费级本地部署大模型的人是一个有参考价值的性能数据点。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →