64GB 内存+16G 显存跑 180B Qwen3.8-Flash-Next,Strata 实测 40-50 t/s
danamir_ · reddit · 2026-10-03
作者分享了用 Strata 在家用电脑上本地运行 Qwen3.8-Flash-Next 的实测:该模型总参数 180B(激活约 125B 中 6B 激活,另有 51B n-gram embedding 与 4B MTP),在 Windows 10、64GB 内存、5070Ti 16GB 显存的机器上以 IQ3XXS 量化跑出约 40-50 t/s,最大支持 256K 上下文。
要点:
- Strata 的优势在于其他本地部署方案不具备的显存卸载机制,还能在两次提示会话之间自动加载/卸载模型(加载约 2 分钟),方便穿插跑 ComfyUI 做图像处理。
- 搭配 mmproj 可获得视觉能力,当图像助手用 32-64K 上下文就够。
- 也给了 llama.cpp --cpu-moe 直跑的备选,但性能约减半。
「Infra」频道最新
- 华为称昇腾在华份额已超英伟达,瓶颈是产能而非需求 — teortaxesTex · 2026-10-03
- iPhone 变身 MacBook 外挂 GPU:Qwen 27B 预填充提速最多 44% — StayLameBro · 2026-10-03
- 美光 CEO:2027-2028 年内存供应将比 2026 年更紧张 — dankvr · 2026-10-03
- mamf-finder 升级:支持 FP8/MXFP4/NVFP4 实测 GPU 真实 TFLOPS — StasBekman · 2026-10-03
- 实测 B200:nvfp4 比 mxfp4 省 9% 算力且精度更高,Blackwell 起建议选前者 — StasBekman · 2026-10-03
- LithosAI 发布 LithosBox:毫秒级快照分叉的 Agent 沙箱 — JiaZhihao · 2026-10-03