软件工程师自建 64GB 显存三卡 3090 本地编程助手全记录

trytoinfect74 · reddit · 2026-09-13

一位不愿长期为 OpenAI/Anthropic 订阅买单、担心厂商涨价与单方面改条款的软件工程师,详细记录了自己组装 64GB VRAM 本地 AI 编程工作站的完整过程。

硬件踩坑与解决方案:

软件栈: 自编译 llama.cpp(开启 CUDA FA、NCCL、CUDA Graphs、LTO 等),运行 Qwen 27B Q80 量化模型,-ngl all 全量卸载,按 14/24/24 张量切分到三张卡,layer split 模式 + --kv-unified。

结论是本地多卡方案已能真正提升他写代码的质量和速度,且规避了订阅成本与条款风险。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →