4 张 8GB 3060 Ti 跑 Qwen3.8-27B:单 agent 120 t/s、150k 上下文
DontWinFrensWthSalad · reddit · 2026-09-27
一位 Reddit 用户放弃购买新显卡,把旧的矿卡 4 张 3060 Ti(每张仅 8GB 显存、功耗限制 110W)组成多卡推理平台,效果出乎意料地好。
关键做法
- 核心是张量并行(tensor parallel):llama.cpp 不支持,先后试了 Turboderp 的 ExL3 和面向 Ampere 卡、支持 TP=4 的 HyperQwen + vLLM 方案。
- 用 ExL3 + MPT 跑 Swift-Qwen3.8-27B 可达约 70 t/s、196k 上下文。
- 换 vLLM 跑 W4A16 fast 变体后:bf16 下 150k 上下文、约 120 t/s;量化 KV cache(kv8)可解锁全 262k 上下文,但速度回落到约 70 t/s。
- 并发几乎无性能损失:可单 agent 高速运行,或 2 个并发 agent 共用大上下文。
结论是与其花一万多买一张 3090,不如升级主板 CPU 复用旧卡,多卡张量并行已是本地推理的可行路线。
「Infra」频道最新
- 开源 AI 需求升温,预测 2027 年消费级算力将供不应求 — JosephJacks_ · 2026-09-27
- 研究者吐槽:光子电路透明够多了,热隔离还远远不够 — jwt0625 · 2026-09-27
- 用 zram 给模型权重卸载扩容?压缩带宽或成推理热路径瓶颈 — Agreeable_Return2632 · 2026-09-27
- 本地推理工具 Splash 1.1.0 发布:支持 GGUF 量化与 MLX 导入,M5 上 27B 跑 50 t/s — wojtek15 · 2026-09-27
- 数据仓库 AI 函数欲降本百倍,让所有数据库厂商可用 — sh_reya · 2026-09-27
- Ollaya本地跑决策模型:RTX 4090上8毫秒答五问 — petrusenko_max · 2026-09-27