Strix Halo 外接 dGPU 实测:低上下文跑分有水分
Hrethric · reddit · 2026-08-25
作者在 Strix Halo 机器上通过 Oculink 接入 R9700 dGPU,实测 Unsloth 量化版 MiniMax M-2.7 后发现:dGPU 上 Q4KXL 反而比 APU 单跑 IQ4XS 更慢,调优数小时后才让 IQ4XS 达到与 APU 单跑相同的生成速度,仅换来 2-3 倍 prompt 处理提升和少量上下文增加。
作者指出,很多展示 dGPU 加速的基准都是在低上下文下跑的,实际存在调优权衡:在 dGPU 放更多层就要牺牲上下文大小或质量,反之保留高量化/未量化上下文则 dGPU 承载的层数更少。帖中附完整 Docker 启动命令与 models.ini 配置(tensor-split、cache-type、batch-size 等参数),供同样想在本机跑大模型的用户参考。
「Infra」频道最新
- MTPLX 让苹果 Silicon 本地推理提速 3 倍 — julianharris · 2026-08-25
- 苏格兰拟建全球第二大数据中心,遭 1600 人反对 — nordicinst · 2026-08-25
- 研究:量子处理器扩展需权衡规模与时空成本 — jwt0625 · 2026-08-25
- 传苹果新款 Mac mini 九月前发布,本地跑 AI 或成溢价卖点 — Scobleizer · 2026-08-25
- 澳大利亚预测 2036 年数据中心耗电将激增近 600% — Polymarket · 2026-08-25
- Nvidia 告知大客户 AI 芯片价格将上涨超 15% — emmanuelvivier · 2026-08-25