双 RTX 3060 实测 Qwen3.8-27B 跑出 50 tok/s
Reddit 用户分享了在双 RTX 3060 12GB 显卡上运行 Qwen3.8-27B 的配置方案。通过使用 llama.cpp 和 MTP 投机解码技术,实测生成速度达到 50.6 tok/s,同时验证了模型的 CUDA 编程能力。
2026-08-15 ~ 2026-08-15 · 2 条相关
- Qwen3.8-27B在双RTX 3060上跑出40 tok/s,实测CUDA编程能力 — anderspitman · 2026-08-15
- 双 RTX 3060 跑 Qwen3.8-27B:50 tok/s 部署配方 — Ecstatic-Wash-7667 · 2026-08-15