Strix Halo 外接 dGPU 实测:低上下文跑分有水分

Hrethric · reddit · 2026-08-25

作者在 Strix Halo 机器上通过 Oculink 接入 R9700 dGPU,实测 Unsloth 量化版 MiniMax M-2.7 后发现:dGPU 上 Q4KXL 反而比 APU 单跑 IQ4XS 更慢,调优数小时后才让 IQ4XS 达到与 APU 单跑相同的生成速度,仅换来 2-3 倍 prompt 处理提升和少量上下文增加。

作者指出,很多展示 dGPU 加速的基准都是在低上下文下跑的,实际存在调优权衡:在 dGPU 放更多层就要牺牲上下文大小或质量,反之保留高量化/未量化上下文则 dGPU 承载的层数更少。帖中附完整 Docker 启动命令与 models.ini 配置(tensor-split、cache-type、batch-size 等参数),供同样想在本机跑大模型的用户参考。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →