5 张显卡也带不动:实测本地运行 Qwen 2.4T 量化版
klicker0 · reddit · 2026-08-14
一位硬核网友尝试在本地运行参数量高达 2.4T 的 Qwen3.8 模型(UD-Q10 极限量化版,体积 397GB)。
- 硬件配置:双 RTX 5090 + 三 RTX 3090,外加 96GB 系统内存。即便如此,模型的总显存+内存需求仍超出现有容量的两倍。
- 运行表现:生成速度仅为 0.25 tokens/sec(生成 178 个 token 耗时 11 分 38 秒)。
- 结论:这种级别的速度完全不具备实用性,即使放任其整夜运行也难以完成任务。虽然超大规模模型开放权重是好事,但目前消费级硬件依然无法在本地有效跑起 2.4T 模型。
「Infra」频道最新
- DeepSeek V4 Pro 0813推理工程实践:1.7T参数MIT协议开源 — philipkiely · 2026-08-14
- 阿里开源MNN推理引擎:赋能端侧大模型 — tom_doerr · 2026-08-14
- AMD 赠送 Ryzen AI Halo 专为 LLM 优化 — JosephJacks_ · 2026-08-14
- 面向 LLM 工程师的 GPU 底层工作原理深度解析 — burny_tech · 2026-08-14
- Vercel AI Gateway 一键接入编程 Agent,支持 300+ 模型 — evilrabbit_ · 2026-08-14
- Dipole Labs 推出 AI 数据中心光路交换机,破解 GPU 空闲难题 — ycombinator · 2026-08-14