16GB 显卡跑 177B MoE:SSD 流式推理实测 9-10 tok/s

TypicalPudding6190 · reddit · 2026-09-28

开发者团队发布 Inferred-Thoughts 推理引擎,让放不进显存+内存的 MoE 大模型从 SSD 按需流式读取专家权重,在 RTX 5060 Ti 16GB + 32GB RAM + Gen5 NVMe 上跑通 Qwen3.8-Flash-Next 177B NVFP4(119 GiB),解码 9-10 tok/s,对比同机 llama.cpp 的 4.9 tok/s 翻倍。

119 GiB 怎么摆:

关键技术与数据:

限制: 仅 RTX 50 系(sm120)、Windows 11/WSL2、贪心解码;附带 OpenAI 兼容 server,支持工具调用(与 Cline 测试中)和内置聊天页。团队预计 v2 通过更好的 SSD 流式优化可到 14-15 tok/s。开源仓库与模型权重均已放出。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →