Strix Halo 主机塞进双 R9700:NVMe 转接实现张量并行提速
Pyrolistical · reddit · 2026-09-21
Reddit 用户在 GMKtec EVO-X2(Strix Halo 平台)上通过 NVMe 插槽转接装了两块 R9700 GPU:机器没有 oculink 或 PCIe 槽,但有两个 NVMe 位,作者用 NVME 转 USB4 硬盘盒加 NVME 转 PCIe 转接卡实现,两条链路均为 PCIe 4.0 x4。
踩坑与解决过程:
- llama.cpp 的 Vulkan 后端张量并行不正确,双卡反而比单卡慢;换 ROCm 构建后解码提速,但 prompt 处理只有单卡的 70%;在编译时加 -DGGMLHIPRCCL=ON 启用 RCCL 后恢复满速。
最终 llama-bench 成绩(Qwen3.8-27B-UD-Q4KXL):张量并行 pp512 达 1069 tok/s、tg128 37 tok/s,对比单卡 1070 / 28——预处理持平、解码提升约 32%。
「Infra」频道最新
- 轻量模型 Laya 将内置 Omarchy M,可本地跑在 Apple GPU 与 ANE 上 — Scobleizer · 2026-09-21
- Meta 宕机:Facebook 与 Instagram 数千用户同时无法访问 — Polymarket · 2026-09-21
- Agent 集群被 KV 缓存黑盒卡住,推理工程师抱怨缺手动控制 — Small_Luck8177 · 2026-09-21
- Laya 移植 MLX:M3 Max 本地跑智能体,速度比 Jev 快 50 倍 — sven_ai · 2026-09-21
- 美国经济里程碑:数据中心与信息处理硬件支出首超住房投资 — rohanpaul_ai · 2026-09-21
- Intel 推 BITCOS 压缩法,把三元 LLM 压到 1.485 比特并提速最高 27% — burny_tech · 2026-09-21