单台Strix Halo跑Qwen大模型,长上下文完胜六卡GPU堆
fallingdowndizzyvr · reddit · 2026-10-01
Reddit 用户实测对比了 AMD Strix Halo(Ryzen AI Max 一体机)与一堆消费级 GPU(2x RTX 5070 Ti、2x RX 7900 XTX、2x RTX 5060 Ti 16GB)运行 Qwen QFN(176B A3B MoE,Q4 量化,约 104GB)的表现。
结果反直觉:在 160K 长上下文下,单台 Strix Halo 全面胜出:
- 六卡 GPU 堆:PP 215.73 / TG 16.29 t/s
- Strix Halo(Gufo 优化后端):PP 1227.12 / TG 22.04 t/s
- Strix Halo(Halo Box 分支):PP 587.99 / TG 21.24 t/s
- Strix Halo(llama.cpp 主线 0.4.1):PP 113.48 / TG 7.06 t/s
核心原因是消费级 GPU 显存不足,多卡流水线与跨卡通信严重拖慢长上下文吞吐,而 Strix Halo 的统一内存优势在长上下文场景下体现得淋漓尽致。后端选择影响也很大:Gufo 优化版比 llama.cpp 主线的 TG 快 3 倍以上。
「Infra」频道最新
- 硅微环调制器突破单通道 200Gb/s,为 AI 光互连降功耗 — jwt0625 · 2026-10-01
- WUSH-KV:数据自适应变换做 2-bit KV cache 量化,集成 SGLang 降 perplexity — ISTA-DASLab · 2026-10-01
- Linewise 视频分析 agent 借 Inco 推理实现单 GPU 吞吐提升 31 倍 — songhan_mit · 2026-10-01
- 存储芯片股亚洲隔夜集体上涨,Java 式狂热回来了? — firstadopter · 2026-10-01
- Boat VMs 被评最便宜的规模化 VM 算力,每月可省数十万美元 — Scobleizer · 2026-10-01
- Orbio 推出 Incognito:为智能体提供端到端加密推理请求 — econoar · 2026-10-01