给 NVIDIA PAIR 加 AMD ROCm 遥测,双节点集群跑通 llama.cpp 路由
Don_Reuter · reddit · 2026-09-11
作者让 NVIDIA 的 Personal AI Router(PAIR)在混合集群上成功路由到 AMD ROCm 节点的 llama.cpp,并写下完整踩坑笔记:
背景:PAIR 只为 NVIDIA 节点提供 GPU 遥测,AMD 节点只报盲 fallback,scheduler 看不到其负载。作者补上了 AMD ROCm 遥测,实现两节点集群(2×R9700,gfx1201)。
关键做法
- PAIR 原生只认 Ollama/LM Studio,作者用自定义 engine manifest 前置一个已有的 llama-swap(OpenAI 兼容)服务器,让调优过的 llama.cpp 直接服务集群。
- 通过 amd-smi(ROCm 7.2.0)提供 AMD GPU 利用率与显存遥测,喂给 scheduler,经 Go race detector 验证。
- 全栈在 Linux/ROCm 上构建运行,与 NVIDIA 节点 PIN-pair 组成两节点集群。
代码由本地 Qwen 模型 vibe-code 完成,review/验证循环也用本地模型——review 确实抓到真问题,测试结果也没造假。
踩坑要点
- 前置 llama-swap 需要 process-mode manifest + adoption:PAIR 探测运行中的端口并收编现有服务器;quirk 是 runtime.bin 必填(虽然从不启动),listmodels 就是 /v1/models → data[].id 的映射。
- Manifest 在构建期嵌入二进制,改磁盘上的 JSON 不重建不重启等于白改(作者为此耗了一小时)。
- Proxy 按协议而非按节点划分,混合集群会在两个 proxy 端口间分裂 inventory,没有统一端点。
- Intel xpu-smi 后端改动未经真机验证,字段和单位可能不对,建议别加入 registry。
「Infra」频道最新
- 斯坦福新指标:混合本地-云路由省 60-80% 成本与能耗 — rohanpaul_ai · 2026-09-11
- 斯坦福论文:本地+云端混合路由可省 60%-80% 算力成本 — rohanpaul_ai · 2026-09-11
- 租 GPU 踩坑实录:vCPU 数量与脚本默认值让成本差 31 倍 — Worldly_North_7213 · 2026-09-11
- 128GB 笔记本本地跑 Qwen3.8 做 Agent 编码,思考 token 才是耗时瓶颈 — deepu105 · 2026-09-11
- AI 数据中心缺燃气轮机,SpaceX 自造稀缺部件或倒逼扩产 — rohanpaul_ai · 2026-09-11
- 从AGI任务时长定义到晶圆厂该不该自训模型的一线观察 — jwt0625 · 2026-09-11