双 V100 运行 DeepSeek Q8:如何实现多实例并行推理?

Kike328 · reddit · 2026-08-30

用户在双 V100 (64GB VRAM) 上运行 DeepSeek Q8 模型进行 HPC 研究,目前单实例生成速度约 20 tok/s。为了提升效率,用户希望通过多实例并行运行独立的 Agent/实验来提高 aggregate tok/s,咨询如何利用 llama.cpp 或 harness 实现这一目标,并探讨是否会受限于算力分配。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →