玩家用 4 张 16GB 显卡搭出本地大模型家庭实验室
HippEMechE · reddit · 2026-07-07
一位 Reddit 用户分享了基于 4 张 16GB 显卡的本地大模型 home lab:主槽 bifurcation 加 PCIe 3.0 x1 转接,跑两个 llama.cpp 实例,部署 Qwen 3.6 推测解码(q40,单实例 15 万上下文),实现约 1000 tok/s 的 prompt 处理与 45-60 tok/s 生成。
他用 opencode 搭了后端管理 llama.cpp 与 token 计数,据估算已省下约 60 美元 API 费用。
「Infra」频道最新
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11
- 本地跑 LLM 选卡:4 张 CMP-170HX 涨价 vs Mac Studio M5 — rumboll · 2026-09-11
- llama.cpp 为 RDNA4 调优 Flash Attention,大上下文提升明显 — pmttyji · 2026-09-11