Qwen3.8-flash 本地实测:Strix Halo 与 3090 双双跑出约 50 tok/s
drdanielbender · x · 2026-10-09
作者对本地运行 qwen3.8-flash-next 做了双平台对比实测:
- AMD Strix Halo 128GB(使用 @high52weeks 的 Halogen 方案)
- RTX 3090 桌面版 + 94GB 显存(使用 @coldniko 的 Strata 方案)
- 两套方案均达到约 50 tok/s,体验流畅
- 作者用它驱动自己的 Hermes agent 处理隐私敏感任务,实现全本地推理
对关注端侧部署与隐私场景的开发者是一份直接的硬件/软件组合参考。
「Infra」频道最新
- Deno 整体并入 Cloudflare,核心工程师随团队入职 — cnakazawa · 2026-10-09
- AI 算力需求爆发,Oxide Computer 获 4.45 亿美元 D 轮融资 — Sethwinterroth · 2026-10-09
- Datology AI 推出 Curation Studio:数据质量是算力乘数 — schwarzjn_ · 2026-10-09
- AI2 拆解 GPU 集群调度:时间预算与公平份额如何提速科研 — Hugging Face Blog · 2026-10-09
- 同款 GPU 加拿大贵两成:出「蒙特利尔溢价」,H100 每小时贵 23% — RichardsonDx · 2026-10-09
- Supabase 大更新:收购 Turso,让编码智能体接管后端搭建 — glcst · 2026-10-09