3060+5060 Ti 双卡张量并行跑 Qwen3.8-27B,实测 50 tok/s
bring_back_the_v10s · reddit · 2026-09-21
网友分享在混合双卡(共 28GB 显存:RTX 5060 Ti 16GB + RTX 3060 12GB、32GB 内存、Ryzen 5 5600、Linux)上用 exllamav3/tabbyAPI 跑 Qwen3.8-27B EXL3 5.0bpw 量化的成功经验。
关键配置与结果:
- 原生张量并行(tensorparallel: native)+ gpusplitauto,上下文 102K,Q8 缓存;
- 开启 MTP 草稿模型后平均约 50 tok/s(40-60 波动),关闭 MTP 降至约 22 tok/s;
- 踩坑:自动切分后 3060 仅剩 1.3GB 余量,手动改 GPU split 会导致引擎挂起,桌面环境占用约 1GB 显存是失衡原因之一;
- 已用它写出一个基于 ratatui 的小型 Rust TUI 应用。
帖内附完整 config.yml,对想在旧卡上跑 27B 模型的人可直接照抄。
「Infra」频道最新
- Anvil 团队组合式形式化验证 Kubernetes 控制平面 — tianyin_xu · 2026-09-21
- 自托管 GLM-5.3 搭 DeepSeek Harness 实测缓存命中率 99.7% — burny_tech · 2026-09-21
- 独立开发者一次开源 4 个硬核系统项目,求工程师毒舌点评 — Accomplished_Row1433 · 2026-09-21
- Andrew Chen:强 LLM 离跑上手机还很远,端侧 AI 原生体验待突破 — andrewchen · 2026-09-21
- Tobi 称本地 Dell 服务器跑 DeepSeek 4.1 Flash,每秒约 300 tokens — BLUECOW009 · 2026-09-21
- Baseten CEO:token 量一年暴涨 40 倍,营收增长约 10 倍 — rohanpaul_ai · 2026-09-21