3060+3080 跑 Qwen3.8 27B:26.8t/s 显存优化配置
Fieser_Fettsack · reddit · 2026-08-19
用户分享在旧 i7 8700 平台上,利用 RTX 3060 (12G) 和 3080 (10G) 双卡 RPC 集群运行 Qwen3.8-27B 的实测配置。通过 llama.cpp RPC 实现约 26.87 t/s 的解码速度和 299 t/s 的预填速度,并提供了详细的 Docker Compose 配置参数。
「Infra」频道最新
- Anthropic 500 亿美元算力建设显示融资非短期瓶颈 — FinanceYF5 · 2026-08-19
- 为何消费级内存紧缺?服务器需求撞车 — davidmanheim · 2026-08-19
- 研究员预判:DDR5 将维持高价,DDR4 或在 DDR6 后回落 — davidmanheim · 2026-08-19
- Inco AI 推出 DFlash 2,推理提速最高 4.6 倍 — igilitschenski · 2026-08-19
- 未来能否在小显存 GPU 上运行 30B+ 参数的大模型? — absurdother · 2026-08-19
- Periodic Labs 基于 Miles 框架训练万亿参数模型,吞吐提速3倍 — hsu_byron · 2026-08-19