32GB 内存+两块杂牌旧卡跑 Qwen3 27B,20t/s 本地编程可行但太慢
pepijndevos · reddit · 2026-09-01
作者用 PCIe 延长线和「乐高」固定,把 AMD RX 7900 和 Nvidia Quadro 5000 两块不同品牌旧卡塞进 32GB 内存的工作站,llama.cpp 跑 Qwen3 27B q4km、128k 上下文全驻 GPU,约 20 token/s。他认为作为本地编程模型完全可用,只是太慢;不想花 1 万美元配新机器,向社区求 1000 美元级别的升级方案(加内存跑 MoE,或换更匹配的 GPU 组合)。
「编程与Agent」频道最新
- 打造个性化 AI Agent:成本极低且适配性格 — bindureddy · 2026-09-01
- 开源 PR 审查 Agent Loupe,支持自定义 — andersonbcdefg · 2026-09-01
- 生产环境 LLM 决策不应依赖「感觉更好」 — camerongreen95 · 2026-09-01
- Hermes Agent 代劳 Slack 邮件监控,自动生成任务初稿 — intellectronica · 2026-09-01
- 开源免费的澳大利亚工作日 MCP 服务器 — Impossible_Bit_2676 · 2026-09-01
- 从零开始,AI Agent 应该优先自动化什么? — omnidimension85 · 2026-09-01