三台异构机器跑本地推理,如何统一服务与监控?
ziyaulhuk12 · reddit · 2026-10-07
Reddit 用户在 AMD(Ryzen 9 9950X + RX 7900 XTX)、NVIDIA(i5-10400 + RTX 3050)和 MacBook Pro M3 三台机器上用 LM Studio/Ollama 跑本地推理,痛点是没有统一视图:无法在一个地方看到各节点加载的模型与版本、token 吞吐、VRAM/统一内存压力等,只能逐台手动查看。他向社区求教:多节点/多 GPU 的服务与路由方案、不用逐机架 Prometheus 的可观测性方案、以及跨节点模型版本管理方法,并表示愿意分享现有配置。
「Infra」频道最新
- 泡沫期创业拿云厂积分的暗坑:克隆、账单陷阱与烂服务 — mkheck · 2026-10-07
- ik_llama.cpp 真的更快吗:多 GPU 实测反被 mainline 大幅超越 — vulcan4d · 2026-10-07
- NVFP4 让 2.4 万亿参数模型只用 1/4 GPU,单 token 成本最高降 73% — ryanshrout · 2026-10-07
- Intel 高管:agentic AI 大量时间耗在等待,关键指标是端到端时长 — ryanshrout · 2026-10-07
- Beff Jezos:解耦推理是未来,异构算力云正当其时 — beffjezos · 2026-10-07
- 「拥有自己的 AI」在技术上到底意味着什么? — Imaginary_Choice_430 · 2026-10-07