双卡 R9700 推理为何慢于单张 5090?Ollama 本地部署排错实录

TheyCallMeDozer · reddit · 2026-08-10

一位开发者分享了基于 AMD Radeon AI PRO R9700 双卡(共 64GB 显存)搭建本地大模型推理服务器的排错经历。在处理 Qwen3.5 9B 模型的并发请求时,该服务器的处理速度远慢于仅使用单张 RTX 5090 的桌面机。

问题排查与现象:

作者正在寻求更优的推理栈(如 vLLM 或 llama.cpp)建议,以同时兼顾高并发吞吐量(针对 9B 模型)和超大上下文分析(针对 32B 模型)的双重需求。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →