3090+Arc B70 混插跑 LLM?Reddit 求解 56GB VRAM 混合方案
overand · reddit · 2026-09-15
楼主目前用 3090(24GB)+4070 Ti(12GB)跑本地 LLM,一张 3090 出故障后想入手 Intel Arc Pro B70,凑出 56GB VRAM。他了解到 llama.cpp 可以用 Vulkan 或 CUDA+OpenVINO/SYCL 双后端加 llama-rpc 做跨卡 tensor split,但担心配置痛苦与性能损失,征求有类似混插经验的用户反馈稳定性与速度。帖子里还附了主机配置:Ryzen 5 3600、128GB DDR4(其中一对内存有坏块,靠降频+badram 参数稳定)、Ubuntu Server 24.04。讨论点集中在异构显卡跑推理的可行性与坑。
「Infra」频道最新
- 得州拟处罚隐瞒用水量的数据中心,AI 算力水资源争议升温 — Polymarket · 2026-09-15
- OpenAI 访谈:内核优化让 GPT-5.6 Sol 服务成本降 20% — TheTuringPost · 2026-09-15
- Devin 接管 H100 自主实验:训练 kernel 峰值内存降 46%、延迟降 52% — AAAzzam · 2026-09-15
- 两大约束下 Mac 跑 AI 反超:统一内存大、无障碍服务助力 computer use — dotey · 2026-09-15
- 5 个生产应用月 200 万请求仅花 6 美元,Cloudflare 全家桶成本碾压 Vercel 组合 — viksit · 2026-09-15
- Google Cloud 携手 Inferact:vLLM 将把 TPU 变为开源推理一等公民 — vllm_project · 2026-09-15