双卡 R9700 推理为何慢于单张 5090?Ollama 本地部署排错实录
TheyCallMeDozer · reddit · 2026-08-10
一位开发者分享了基于 AMD Radeon AI PRO R9700 双卡(共 64GB 显存)搭建本地大模型推理服务器的排错经历。在处理 Qwen3.5 9B 模型的并发请求时,该服务器的处理速度远慢于仅使用单张 RTX 5090 的桌面机。
问题排查与现象:
- 并发失效:尽管设置了 OLLAMANUMPARALLEL=4,日志显示 Ollama 仍将请求串行排队,导致四个请求依次延迟完成。
- GPU 利用率极度不均:rocm-smi 显示一张显卡满载(100%),而另一张完全闲置(0%)。只有运行 32B 等大模型需要切分时,双卡才会同时工作。
- 显存占用异常:由于配置了高达 26万(262k)的上下文窗口,KV cache 占用了近 10GB 显存,导致 9B 模型在 Ollama 中的总显存占用达到 20GB 左右。
- 底层报错:日志中出现了 rocblaslt error,提示无法加载特定的 TensileLibrary 文件。
作者正在寻求更优的推理栈(如 vLLM 或 llama.cpp)建议,以同时兼顾高并发吞吐量(针对 9B 模型)和超大上下文分析(针对 32B 模型)的双重需求。
「Infra」频道最新
- Tobi 开源 walgit:无数据库的单二进制 Git 服务器 — jevon · 2026-08-24
- s3collections:用S3构建分布式系统持久化数据结构 — andersonbcdefg · 2026-08-24
- 预测市场:年底前美一州实施数据中心禁令概率 68% — Polymarket · 2026-08-24
- Ramp 用本地模型省钱,引发业界对 AI 成本反思 — annetgriffin · 2026-08-24
- GitHub Actions 额度耗尽,是时候迁移到自建 VPS 了吗? — MicahBerkley · 2026-08-24
- Ubuntu 计划成为 RISC-V CPU 的参考操作系统 — bookwormengr · 2026-08-24