本地部署进阶:一台机器混用N卡和A卡跑不同大模型
Curious-Pen5547 · reddit · 2026-08-06
一家贸易公司计划充分利用现有硬件,询问能否在同一台 PC 上同时安装 NVIDIA RTX 5090 和老旧的 AMD 显卡,以分别运行不同参数规模的本地大模型。
具体需求如下:
- 主力模型:在 5090 显卡上运行定制微调的 Qwen 27B 模型,处理复杂任务。
- 辅助模型:在 12GB 显存的 AMD 显卡上运行约 4B 参数的轻量级模型(如 Gemma),专门处理每天仅需运行几次的简单文本摘要任务。
- 目的:通过将简单任务卸载到弱模型,避免阻塞主力大模型的算力队列,提升整体效率。
该场景基于 llama.cpp 部署,探讨了异构 GPU 混合调度的可行性。
「Infra」频道最新
- Sapiom 获 3500 万美元 A 轮融资,推出 AI 智能体降本基建 — thisguyknowsai · 2026-08-06
- 谷歌云 Filestore 引入 Colossus 底层,实现容量与 IOPS 独立扩展 — rseroter · 2026-08-06
- 8x DGX Spark 节点开放世界多智能体实测 — NVIDIAAI · 2026-08-06
- 16x GB10 集群成功跑通 Kimi K3,峰值吞吐达 38tps — NVIDIAAI · 2026-08-06
- RTX 5090 本地大模型量化与 8GB 显存智能体性能基准测试 — max_paperclips · 2026-08-06
- 英伟达探讨基于专有数据构建安全的企业级 AI — nvidia · 2026-08-06