双 3060 跑 Qwen 27B Q4 量化,实测生成速度约 44-50 tok/s

jacek2023 · reddit · 2026-09-26

作者平时用 4x3090 跑 Qwen3.8-27B(parallel=2 同时跑两个 agent),因需临时挪用机器,改在 2xRTX 3060 的机器上用 llama.cpp 跑 Qwen3.8-27B 的 UD-Q4KM 量化版。

关键做法与结果:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →