16GB 显卡跑 177B MoE:SSD 流式推理实测 9-10 tok/s
TypicalPudding6190 · reddit · 2026-09-28
开发者团队发布 Inferred-Thoughts 推理引擎,让放不进显存+内存的 MoE 大模型从 SSD 按需流式读取专家权重,在 RTX 5060 Ti 16GB + 32GB RAM + Gen5 NVMe 上跑通 Qwen3.8-Flash-Next 177B NVFP4(119 GiB),解码 9-10 tok/s,对比同机 llama.cpp 的 4.9 tok/s 翻倍。
119 GiB 怎么摆:
- 稠密权重 4.4 GiB + 最热专家 8.8 GiB 放显存
- token 嵌入 0.6 GiB + 次热专家 6 GiB 用锁定内存
- 其余 48.5 GiB 路由专家 + 50.7 GiB n-gram 表留在 SSD,按需流式读取
关键技术与数据:
- GCLOCK 驻留淘汰 + lookahead prefetch 提前预取下一层专家
- NVFP4 矩阵乘直接在 tensor core 上 FP4×FP4,不解包
- 每 token 约用 480 个专家,约 377 个命中显存/内存,103 个从 SSD 读取(约 270 MiB/token),约 75% 命中率是达到 9 tok/s 的关键
- prefill 49.2 tok/s;几乎只读不写,SSD 磨损小,但长时间运行 SSD 到 70°C
- 也支持 Qwen3.6-35B-A3B NVFP4,调优后 4k 上下文解码 47.3 tok/s
限制: 仅 RTX 50 系(sm120)、Windows 11/WSL2、贪心解码;附带 OpenAI 兼容 server,支持工具调用(与 Cline 测试中)和内置聊天页。团队预计 v2 通过更好的 SSD 流式优化可到 14-15 tok/s。开源仓库与模型权重均已放出。
「Infra」频道最新
- 云南锗业财报:InP 原料铟本土供应紧张,放开管制也无货可出 — pstAsiatech · 2026-09-28
- Apple 端侧模型 fm 搭决策小模型 Jev,路由测试全对比 — jasonkneen · 2026-09-28
- 估算:粗略描述人体生物学需千亿亿字节,超全球存储千倍 — IgorCarron · 2026-09-28
- 6 张 RTX 6000 满血 325W 长期运行, GPU 温度仅 41°C — TheZachMueller · 2026-09-28
- RTX 3090 本地跑 MiniMax H3 视频生成:每步 6294 秒还翻车 — play150 · 2026-09-28
- Innosilicon:中国芯片公司背后的关键 IP 供应商 — pstAsiatech · 2026-09-28