16GB 显存跑 176B MoE:TensorSharp 实测胜过 Strata

fuzhongkai · reddit · 2026-10-04

作者在 RTX 3080 笔记本(16GB 显存)+ 32GB 内存 + SSD 上跑通了 Qwen3.8 Flash Next 176B MoE 模型,用的是其开源推理引擎 TensorSharp。

核心思路不是把 SSD 当最后兜底的交换空间,而是量化 + 围绕 MoE 执行的分层统一调度:让缓存、显存、内存、SSD 各层协同,把合适的专家权重在合适时机放在合适的层级。

与 Strata 的对比测试:

作者结论:对超大稀疏 MoE 模型,关键问题不再是「内存够不够装下模型」,而是「运行时协调显存/内存/SSD/缓存的效率有多高」——配合好量化与内存层级,消费级硬件也能做离谱的事。作者还征集 llama.cpp、Strata 等其他方案在同款硬件上的对比数据。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →