Strix Halo 外接 R9700 混合推理提速,跑分超 DGX Spark

darklordfireape · reddit · 2026-10-01

作者历经数月迭代其 llama-halo-hybrid 项目(MIT 开源,GitHub 可查):在 Strix Halo APU 上外接一张 R9700 GPU(经 PCIe 延长线、OCuLink 或雷雳坞),将模型稠密层、KV cache 和部分层放 GPU,其余交给 APU。基于魔改 llama.cpp,无需特制量化,支持 Qwen、GLM 等模型。

实测 Qwen-3.8-flash-next(Q4/Q4KXL)解码破 60+ tok/s、预填充 2000+ tok/s,支持完整 256k 上下文,性能超过价格更高的 DGX Spark,Swift-1.5 变体成绩更好。作者提醒单用 Strix Halo 的用户可改看 gufo 项目,并征求其他 sidecar GPU 的适配需求。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →