gufo-Qwen3.6-35B 本地实测:Strix Halo 上 3095 tok/s 预填充
nubela · reddit · 2026-10-03
Reddit 用户分享 gufo-Qwen3.6-35B-A3B-Q6dense 量化模型在 AMD Strix Halo 平台上的本地推理成绩:prefill 达 3095 tok/s,decode 约 190 tok/s。项目已在 GitHub 开源,对关注消费级本地部署大模型的人是一个有参考价值的性能数据点。
「Infra」频道最新
- 传 Terafab 目标年产 1 TW 算力,约为当前全球 AI 算力产出 50 倍 — XFreeze · 2026-10-03
- 单卡跑出 2200 prefill,消费级本地推理速度一周涨近十倍 — oran_ge · 2026-10-03
- Micron 称 NVHBM 可提升利润率,质疑者算账:价值流向了谁 — AccBalanced · 2026-10-03
- 三星全球首个做出10a级DRAM working die,2028量产IGZO晶体管 — zephyr_z9 · 2026-10-03
- 买家秀翻车:AliExpress 迷你主机 BIOS 里硬编码假 N150 型号 — Ok-Shower7286 · 2026-10-03
- Crusoe CEO 上 20VC:融资 64 亿美元谈数据中心、GPU 折旧与能源账 — 20VC · 2026-10-03