16GB 显存+32GB 内存跑通 69GB Qwen3.8 Next,附完整参数
ironicstatistic · reddit · 2026-09-14
作者在 RTX 5060 Ti 16GB + 32GB DDR5 的低配机器上跑通约 69GB 的 Qwen3.8-Flash-Next REAP 剪枝版(专家数从 512 剪到 320),Unsloth 量化版均无法运行。
关键做法:
- N-gram/PLE 嵌入部分约 29.5GB,是纯查找表,可通过 lazy mmap 留在 SSD/内存流式读取,无需占满显存计算——这是能跑起来的核心
- 其余约 39.4GB(专家、注意力、KV cache)用 --load-mode none 全部压入 RAM+VRAM
- --n-cpu-moe 34 恰好是 64k 上下文下的临界值:多了显存溢出,少了系统内存不足触发 swap 崩溃
- 建议保留至少 2GB 系统内存给 OS;可用 tensor override 对单层做部分 offload 来微调避开 OOM
「Infra」频道最新
- 人类攻击者 8 秒打穿 Marimo 漏洞并横移至 SSH 堡垒机 — ChuckDBrooks · 2026-09-15
- Neocloud 大战拉开:AI 算力基建正分化为四大类玩家 — DavidLinthicum · 2026-09-15
- 推理工程入门路线:Docker 里跑 vLLM 实测 TTFT 与吞吐 — malliktwts · 2026-09-15
- MinIO:兼容 S3 API 的开源对象存储,彻底免掉数据出口费 — thisdudelikesAI · 2026-09-15
- NVIDIA 官宣 GTC 华盛顿站:2026 年 12 月 1 日黄仁勋主题演讲 — nvidia · 2026-09-15
- 民调:61% 美国人反对建 AI 数据中心,年轻人反对最烈 — justin_hart · 2026-09-15