单台Strix Halo跑Qwen大模型,长上下文完胜六卡GPU堆

fallingdowndizzyvr · reddit · 2026-10-01

Reddit 用户实测对比了 AMD Strix Halo(Ryzen AI Max 一体机)与一堆消费级 GPU(2x RTX 5070 Ti、2x RX 7900 XTX、2x RTX 5060 Ti 16GB)运行 Qwen QFN(176B A3B MoE,Q4 量化,约 104GB)的表现。

结果反直觉:在 160K 长上下文下,单台 Strix Halo 全面胜出:

核心原因是消费级 GPU 显存不足,多卡流水线与跨卡通信严重拖慢长上下文吞吐,而 Strix Halo 的统一内存优势在长上下文场景下体现得淋漓尽致。后端选择影响也很大:Gufo 优化版比 llama.cpp 主线的 TG 快 3 倍以上。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →