Strix Halo 外接 R9700 混合推理提速,跑分超 DGX Spark
darklordfireape · reddit · 2026-10-01
作者历经数月迭代其 llama-halo-hybrid 项目(MIT 开源,GitHub 可查):在 Strix Halo APU 上外接一张 R9700 GPU(经 PCIe 延长线、OCuLink 或雷雳坞),将模型稠密层、KV cache 和部分层放 GPU,其余交给 APU。基于魔改 llama.cpp,无需特制量化,支持 Qwen、GLM 等模型。
实测 Qwen-3.8-flash-next(Q4/Q4KXL)解码破 60+ tok/s、预填充 2000+ tok/s,支持完整 256k 上下文,性能超过价格更高的 DGX Spark,Swift-1.5 变体成绩更好。作者提醒单用 Strix Halo 的用户可改看 gufo 项目,并征求其他 sidecar GPU 的适配需求。
「Infra」频道最新
- 分析师:DRAM 供给仍追不上需求, NAND 份额现流失 — BenBajarin · 2026-10-01
- 美光:人形机器人存储需求可比自动驾驶,成内存需求新引擎 — McDonaghMatthew · 2026-10-01
- antirez 赞 Framework 桌面机 192GB 内存,可外接 GPU 混合推理 — antirez · 2026-10-01
- 5090 混搭 Intel Arc B70 跑本地模型:带宽减半换大上下文值不值 — indiealexh · 2026-10-01
- 把数据中心搬上太空?Google 研究太空环境给 AI 芯片散热 — GraceToSentience · 2026-10-01
- 推理引擎 Magnitude 登顶 HN:本地跑开源模型比 llama.cpp 快至 2 倍 — nickbaumann_ · 2026-10-01