两块"奶奶级"P40 跑出 48 tok/s:老显卡llama.cpp 调优实录

Jumpy-Operation-4615 · reddit · 2026-09-06

一位自称完全不会写代码的普通 PC 用户,靠 Codex 帮忙调优,在自建的 2x Tesla P40(整机约 1100 美元)集群上把 Qwen 27B Q8 的推理速度从约 15 tok/s 提升到短上下文最高 48 tok/s、prefill 约 440 tok/s。

关键发现与做法:

结论:老数据中心显卡仍有可观余力,瓶颈多在配置而非硬件。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →