双 RTX 3060 实测 Qwen3.8-27B 跑出 50 tok/s

Reddit 用户分享了在双 RTX 3060 12GB 显卡上运行 Qwen3.8-27B 的配置方案。通过使用 llama.cpp 和 MTP 投机解码技术,实测生成速度达到 50.6 tok/s,同时验证了模型的 CUDA 编程能力。

2026-08-15 ~ 2026-08-15 · 2 条相关