双 V100 运行 DeepSeek Q8:如何实现多实例并行推理?
Kike328 · reddit · 2026-08-30
用户在双 V100 (64GB VRAM) 上运行 DeepSeek Q8 模型进行 HPC 研究,目前单实例生成速度约 20 tok/s。为了提升效率,用户希望通过多实例并行运行独立的 Agent/实验来提高 aggregate tok/s,咨询如何利用 llama.cpp 或 harness 实现这一目标,并探讨是否会受限于算力分配。
「Infra」频道最新
- SpaceX 自建涡轮铸造厂,为 AI 算力解决供电瓶颈 — rohanpaul_ai · 2026-08-30
- 已有强力 PC 跑 LLM,Mac 还该上 64GB 内存吗? — gappyvalley · 2026-08-30
- llama.cpp 启用 NUMA 镜像,双路 EPYC 推理性能暴增 137% — mattescala · 2026-08-30
- 推个人 AI 数据中心 Autonomous,2.6 万美元起售 — dee_hw · 2026-08-30
- 双 A100 显卡当前最佳的 LLM 推理方案是哪个? — Theio666 · 2026-08-30
- 分析称 Meta 算力资产被低估,对外销售潜力巨大 — RihardJarc · 2026-08-30