实测 Qwen 3.8:3080Ti + Strix Halo 跑通 1M 上下文
TrifleHopeful5418 · reddit · 2026-08-18
作者分享了在 AMD Strix Halo (128GB) + 外接 3080Ti (12GB) 环境下运行 Qwen 3.8 的性能数据:
- 262K 上下文 (Q6):仅用 iGPU 约 10 tps;开启 MTP (n=4) 约 24 tps;FastMTP 卸载至 3080Ti 约 28 tps。
- 262K 上下文 (Q4km):分层部署(部分权重 + FastMTP 在 3080Ti)约 53 tps。
- 1M 上下文 (Q4km):分层部署约 45 tps。
虽然速度不及 5090 平台,但仍有大量内存余量可同时加载 Embedding 和 Reranker 模型。作者计划将其与 4x3090 上运行的 Qwen 3.6-35B (450 tps) 进行对比。
「Infra」频道最新
- 日志分析显示 OpenAI/Anthropic 暂未抓取 llms.txt — gaganghotra_ · 2026-08-18
- M4 Pro 实现单目深度模型 8ms 实时推理 — fofrAI · 2026-08-18
- Cloudflare Durable Objects 上线版本流量监控面板 — ritakozlov · 2026-08-18
- Magnitude CLI 新增模型目录,自动评测本地硬件适配性 — Dan_Jeffries1 · 2026-08-18
- 从本地到主权 AI:产业边界在哪里? — rio_ARC · 2026-08-18
- City2Graph 库发布:地理空间数据转图结构 — tom_doerr · 2026-08-18