两张不配对的 Tesla V100 组成本地推理平台,预填充达 1377 tok/s

OkBase5453 · reddit · 2026-09-20

作者用一张 16GB + 一张 32GB 的旧款 Tesla V100-PCIE(共 48GB 显存)在 Proxmox/LXC 环境中搭建本地 LLM 推理平台,跑 Qwen3.8 27B Q6KM 实测:2k 上下文预填充 1376.9 tok/s、解码 39.9 tok/s,16k 上下文预填充仍有 1221.5 tok/s。

关键调优结论:

最终日常配置:mainline llama.cpp + Qwen3.8 27B Q6 + tensor split + Flash Attention + Q8 KV + NUMA distribute + 大 batch。在「一张肾换一块 GPU」的市场环境下,旧 V100 仍有可观生产力。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →