两块"奶奶级"P40 跑出 48 tok/s:老显卡llama.cpp 调优实录
Jumpy-Operation-4615 · reddit · 2026-09-06
一位自称完全不会写代码的普通 PC 用户,靠 Codex 帮忙调优,在自建的 2x Tesla P40(整机约 1100 美元)集群上把 Qwen 27B Q8 的推理速度从约 15 tok/s 提升到短上下文最高 48 tok/s、prefill 约 440 tok/s。
关键发现与做法:
- KV cache 用 F16 而非 Q8:F16 缓存让 MTP 投机解码的接受率显著高于 Q8,是需要配合调参但收益最大的改动。
- 使用自建 NCCL 的 llama.cpp/p40.cpp,tensor split 1:1 双卡、Flash Attention 开启、draft-mtp + ngram-simple 投机解码(draft 最大 6)。
- 长 22 万 token 的单一上下文槽;63,900-token prefill 实测 258 tok/s,且换后缀时 LCP 前缀缓存命中 fkeep=1.000,仅重算 4 个 token。
- 附完整生产配置命令行,含采样参数与 reasoning 设置。
结论:老数据中心显卡仍有可观余力,瓶颈多在配置而非硬件。
「Infra」频道最新
- GPU 租用哪家稳:giffmana 建议考虑 Thunder/RunPod,月花费超 $1000 — giffmana · 2026-09-06
- 「芯片版 OpenRouter」被认为是价值百亿美元级的机会 — mishig25 · 2026-09-06
- NYT 调查:被制裁浪潮集团借美国子公司 Aivres 续购 Nvidia 顶级 AI 芯片 — ShakeelHashim · 2026-09-06
- 开源脚本让旧安卓变身 GPU 加速 Linux 桌面或智能家居服务器 — tom_doerr · 2026-09-06
- 3090+魔改64GB CMP 170HX 双卡跑 H3 频遇 OOM,求固定显存分配方案 — JustinPooDough · 2026-09-06
- Baseten 工程师出书《Inference Engineering》附学习资源清单 — kmeanskaran · 2026-09-06