如何让 llama.cpp 正确支持多 GPU 显存
erazortt · reddit · 2026-08-22
用户在尝试使用 llama.cpp 跨越两张 GPU(一张 Blackwell 5000 48GB 和一张 3090 24GB)运行 Deepseek V3 的 120GB 量化模型时遇到性能瓶颈。尝试了包括 --split-mode layer、手动分配层张量到不同 GPU 以及调整张量并行等多种方案,但要么显存分配失败,要么推理速度反不如单卡。用户寻求关于如何正确配置多 GPU 卸载以提升性能的解决方案。
「编程与Agent」频道最新
- Claude Code 防失控:10 种指令放置机制详解 — bibryam · 2026-08-22
- DeepMind 新智能体零输入解决数学猜想,自动防幻觉 — thisguyknowsai · 2026-08-22
- Agent 系统后端架构设计:从 API 到防坑实战 — kmeanskaran · 2026-08-22
- 微软推LoopsBench评测长周期Agent,当前最佳仅解25%任务 — 机器之心 · 2026-08-22
- 两篇智能体自改进论文入选 EMNLP:9B 模型改 harness 效果追平 Opus — yuyinzhou_cs · 2026-08-22
- Claude Forge:引入独立审查 Agent 的代码工作流 — Nice_Operation4587 · 2026-08-22