32GB 内存+两块杂牌旧卡跑 Qwen3 27B,20t/s 本地编程可行但太慢

pepijndevos · reddit · 2026-09-01

作者用 PCIe 延长线和「乐高」固定,把 AMD RX 7900 和 Nvidia Quadro 5000 两块不同品牌旧卡塞进 32GB 内存的工作站,llama.cpp 跑 Qwen3 27B q4km、128k 上下文全驻 GPU,约 20 token/s。他认为作为本地编程模型完全可用,只是太慢;不想花 1 万美元配新机器,向社区求 1000 美元级别的升级方案(加内存跑 MoE,或换更匹配的 GPU 组合)。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →