两台 24GB 机器本地跑 Qwen3 27B:仅 3~4 tok/s 且任务中途失败
shadyshak · reddit · 2026-09-16
作者用两台机器(Minisforum UM790 Pro 和 Ryzen 9 7940HS + Radeon 780M,均 24GB 内存)通过 Ollama 跑 Qwen3 8:27B 测试同一个「WiFi 路由器统计应用」编码任务。
结果显示:两台机器生成速度分别仅约 3.2 和 4.7 tokens/s,一次完整运行耗时 1113 分钟;更糟的是两个实例都无法完成任务,一个中途停止、一个输出被截断,继续追问时模型停止输出或只输出极少 token。两台机器的策略还明显不一致(一个先列方案、一个直接写码)。
对想在小内存设备上本地跑 27B 级模型的人,这是一个速度与任务完成度的双重警示。
「Infra」频道最新
- 曝苹果自研芯片打造企业级 AI 服务器,最早 2026 年落地 — Polymarket · 2026-09-16
- 花旗分析师:HBM 需求 2027 年将暴增 62%,2028 年再增 69% — TiernanRayTech · 2026-09-16
- antirez 开源 DwarfStar 融合内核库,MIT 许可随便拿去用 — antirez · 2026-09-16
- 手里 A30/A40 加新购 48GB Pro5000,这堆 GPU 怎么用好? — OvertaxedOne · 2026-09-16
- 追踪 agent 网络调用:单次编辑 760KB,弃用 agent 循环月账单 400 刀变百刀内 — cgouguen · 2026-09-16
- 3 张 3090 跑 1M 上下文:Qwen3.8-Flash-Next 的 KV cache 可卸载到内存 — sadnessdevil · 2026-09-16