64GB 内存 iGPU 迷你主机能否跑 Qwen Flash?社区探索端侧部署
SomeITGuyLA · reddit · 2026-10-03
一位 IT 从业者探讨在非 Mac 的 64GB 统一内存迷你主机(iGPU 为 780M)上运行 Qwen Flash Next 的可行性。社区已有人用 12GB VRAM + 64GB 内存跑起来,Mac 统一内存方案也已验证。作者目前用 llama.cpp(vulkan)以 Q2 量化跑 125B Ling 3.0 Flash,尚可用;他设想把 Qwen Flash Next 的 ngrams 卸载到 SSD 以低速率运行,但 llama.cpp 目前不支持此做法,其他推理引擎也基本不兼容 vulkan。
「Infra」频道最新
- Modal VM 沙箱正式 GA:一套流程跑起 Docker Compose 应用、测试与编码 Agent — charles_irl · 2026-10-03
- 793 人社区投票:oMLX 以 55.5% 成最受欢迎的 Apple MLX 引擎 — HankYeomans · 2026-10-03
- 本地 AI 用户吐槽:为什么大家都甘当「驯兽师」,忍受复杂的折腾流程 — kathi7 · 2026-10-03
- AI 网关成生产级 AI 栈关键控制层,八大核心能力盘点 — goyalshaliniuk · 2026-10-03
- 8GB 显存党的日常:苦盼 Qwen4 35B A3B,先用 Gemma 26B QAT 解馋 — RobustLokiX · 2026-10-03
- 单台 128GB Strix Halo 跑 300B 级 MoE:Kyojin 引擎实测 GLM 26-30 tok/s — Yaniss916 · 2026-10-03