64GB 内存之痛:Strata 让本地跑 Qwen3.8-Flash-Next 提速到 60 t/s
Cautious_Chicken_604 · reddit · 2026-10-04
一位本地 LLM 玩家分享了双卡+64GB 内存的取舍困境:R9700 跑日常模型 Qwen3.8-27B Q6(约 35 t/s),RTX 5060 Ti 用 ComfyUI 跑图像/视频推理。
- 此前在 Vulkan 下用双卡跑 Qwen3.8-Flash-Next 的 93GB IQ4XS 量化只有 15 t/s,无法日用。
- 换用 Strata 跑 70 多 GB 的 IQ3XXS 量化,先在 llama.cpp 用系统内存+R9700 跑出 21 t/s;改用 Strata 后达到约 60 t/s,终于达到日用标准。
- 代价是 QFN 加载后系统内存占用 96%,ComfyUI 里的 Minimax H3 等吃内存的推理任务无法同时进行。
作者表示「能跑上这个模型是福气,但要二选一是诅咒」,升级 128GB 内存又因预算有限暂不考虑。
「Infra」频道最新
- BF16 舍入破坏守恒律,FlashAttention 梯度训练后期爆炸 — HongyiWang10 · 2026-10-04
- 玩家用 BC-250 成功跑通 PyTorch CUDA 训练并做成系统镜像 — redfoxkiller · 2026-10-04
- 华为 950 超节点宣称支持 550B、1.6T 扩展至 10T 级模型训练 — teortaxesTex · 2026-10-04
- 华为昇腾超节点:910C部署超1000套,40多个大模型完成原生预训练 — teortaxesTex · 2026-10-04
- 算账:昇腾950DT单卡TDP达950W,B200密集FP8能效约为其4.4倍 — teortaxesTex · 2026-10-04
- 联通提出异构分组MoE架构MoHGE,参数减20%入选ACL 2026 — 量子位 · 2026-10-04