两台 24GB 机器本地跑 Qwen3 27B:仅 3~4 tok/s 且任务中途失败

shadyshak · reddit · 2026-09-16

作者用两台机器(Minisforum UM790 Pro 和 Ryzen 9 7940HS + Radeon 780M,均 24GB 内存)通过 Ollama 跑 Qwen3 8:27B 测试同一个「WiFi 路由器统计应用」编码任务。

结果显示:两台机器生成速度分别仅约 3.2 和 4.7 tokens/s,一次完整运行耗时 1113 分钟;更糟的是两个实例都无法完成任务,一个中途停止、一个输出被截断,继续追问时模型停止输出或只输出极少 token。两台机器的策略还明显不一致(一个先列方案、一个直接写码)。

对想在小内存设备上本地跑 27B 级模型的人,这是一个速度与任务完成度的双重警示。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →