双 RTX 3060 跑 Qwen3.8-27B:50 tok/s 部署配方

Ecstatic-Wash-7667 · reddit · 2026-08-15

Reddit 用户分享了在双 RTX 3060 12GB 上运行 Qwen3.8-27B 的 llama.cpp 配置,使用 MTP 投机解码,达到 50.6 tok/s 的生成速度,预填充 573 tok/s,VRAM 占用 23.2/24.0 GiB。

所属事件:双 RTX 3060 实测 Qwen3.8-27B 跑出 50 tok/s(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →