两张不配对的 Tesla V100 组成本地推理平台,预填充达 1377 tok/s
OkBase5453 · reddit · 2026-09-20
作者用一张 16GB + 一张 32GB 的旧款 Tesla V100-PCIE(共 48GB 显存)在 Proxmox/LXC 环境中搭建本地 LLM 推理平台,跑 Qwen3.8 27B Q6KM 实测:2k 上下文预填充 1376.9 tok/s、解码 39.9 tok/s,16k 上下文预填充仍有 1221.5 tok/s。
关键调优结论:
- tensor split 优于 layer split:tensor split + 主卡设为 32GB V100 后从 981→1377 pp tok/s、23→40 tg tok/s,不切分则只有 967/18。
- 64k 上下文用 1:1.5 切分比跑 Q8,预填充 664 tok/s。
- 用 ikllama.cpp 跑 177B/6B 激活的 MoE 模型(Flash Next Q4,103GB GGUF),跨双卡解码约 26 tok/s。
- NInfer 框架跑 NVFP4 量化 27B,8k 预填充 927 tok/s。
最终日常配置:mainline llama.cpp + Qwen3.8 27B Q6 + tensor split + Flash Attention + Q8 KV + NUMA distribute + 大 batch。在「一张肾换一块 GPU」的市场环境下,旧 V100 仍有可观生产力。
「Infra」频道最新
- Jev 式并行结构化推理让 350M 小模型快 63 倍,代码已开源 — helloiamleonie · 2026-09-20
- 开发者用 Jev 搭建 SLO 感知 LLM 推理路由,按质量延迟成本选模型 — ai · 2026-09-20
- 忆阻器网络研究:让材料本身成为模型,自学重组计算 — bravo_abad · 2026-09-20
- Crusoe 与 Perplexity 签多年云协议,供其专用 Nvidia GB300 集群 — Beth_Kindig · 2026-09-20
- 整站 arXiv 搬上 Hugging Face:314 万篇论文 16TB 全格式 — secemp9 · 2026-09-20
- SF Compute 对谈交易所传奇 Jaycobs:算力期货市场如何搭建 — andriy_mulyar · 2026-09-20